AI 代理/評測
SkillProx、エージェントスキルを検証して再収束――Qwen3.6-27Bの表タスク精度が54.5%に向上
SkillProxは、モデルが提案したスキル変更をそのまま採用するのではなく、タスクを再実行し、性能が低下したバージョンをロールバックしたうえで、効用が負の知識ユニットを削除する。3種類のQwenモデルはいずれも表タスクで性能が向上したが、著者らが現時点で公開しているのは、コミットが2件しかない実質的に空のリポジトリだけだ。
Archive
技術ニュース 977 件
AI 代理/評測
SkillProxは、モデルが提案したスキル変更をそのまま採用するのではなく、タスクを再実行し、性能が低下したバージョンをロールバックしたうえで、効用が負の知識ユニットを削除する。3種類のQwenモデルはいずれも表タスクで性能が向上したが、著者らが現時点で公開しているのは、コミットが2件しかない実質的に空のリポジトリだけだ。
RAG/文件理解
DocMemoは、初回検索のtop-kページを最終結果とはみなさず、推論のフィードバックをページ関連度分布へ反映して再サンプリングする。3層のメモリは長文書QAの性能を向上させる一方、評価はGPT-4.1に依存しており、公開リポジトリも依然として非常に簡素だ。
推論系統
CoBaはまず少数の回答候補を生成し、候補間の不一致度と検証スコアに応じて、追加サンプリングを行うか、より強力な検証器を有効にするかを決定する。5つの推論ベンチマークでマクロ平均正解率85.13%を達成したが、結果はオフラインの候補プールを用いたリプレイによるものであり、オンラインサービスでの実測ではない。
AI 安全與網路攻防
OpenAIは、サイバー攻撃研究に対する回答拒否率を抑える専用モデルGPT‑5.6‑Cyberを、一般APIではなく審査制のDaybreak Redで提供する。同社はそのサイバー攻撃能力をHighと評価し、Criticalには達していないとしているが、完全版のsystem cardはまだ公開されていない。
開放模型與端側推論
Muse Glimmerは、マルチモーダル入力、ツール呼び出し、失敗時の再試行を、コンシューマー向けハードウェアにデプロイ可能な30BのDenseモデルに統合した。Apache 2.0ライセンスの重みと公式GGUFはすでに公開されているが、性能および安全性の数値は現時点で主にMeta自身の評価に基づいている。
代理評測與可觀測性
上海人工知能研究所がA²Eを公開した。Agent Task Protocolにより、ベンチマーク、エージェントシェル、軌跡評価を分離する。1,035回のペアリング実験から、シェルがツール使用とtokenコストに影響することが示された一方、サンプル数はフレームワークのランキングを裏付けるには不十分だ。
代理記憶研究
TEPAは長期メモリに取り消し可能な有効状態を導入し、新たな証拠によって覆された内容を通常の検索対象から除外しながら、監査記録として保持する。この手法はシングルホップの矛盾を解消できる一方、マルチホップや262Kの長大なコンテキストではほぼ機能しない。
RAG 與金融 AI
FinRankは、単に数値的に正しい回答を生成するだけでなく、企業、期間、開示文脈のすべてが正しい証拠をSEC文書から見つけるようシステムに要求する。データセットと評価コードは公開されているが、非商用ライセンスとアノテーション上の制約が採用方法に影響する。
評測與可重現性
Orcetraは当初、513件のOpenMLデータセットでFLAMLとAutoGluonを大幅に上回ったと主張していたが、著者による監査でテストセットのリークと計算資源の不公平が判明した。プロトコル修正後、再実行したサブセットでは3システム間に統計的有意差は見られなかった。
醫療 AI 與代理訓練
Googleのチームは、模擬患者、文書作成ツール、多次元の臨床報酬を組み合わせ、Gemini 3.5 Flashにマルチターン強化学習を実施した。モデルは敵対的な問診で危険な兆候の見落としを減らしたが、訓練システムはオープンソース化されておらず、実患者を対象とする前向き検証も完了していない。
模型訓練與最佳化
新たな実験により、Transformerの隠れ層行列をMuonで訓練し、埋め込みと出力ヘッドをAdamWで更新すると、モデルはモジュラー演算をより速く学習する一方、解法を安定して維持できないことが判明した。いずれかのパラメータ群を凍結すると崩壊を防げることから、問題は表現と読み出しインターフェースの同時ドリフトに起因するとみられる。
代理框架與可重現性
Shepherdはモデル呼び出し、ツール操作、ファイル変更を永続的な実行トレースとして記録し、変更がワークスペースに反映される前にユーザーが確認または破棄できるようにする。一方、最新のドキュメントでは、論文とプロジェクトのホームページで紹介されているmeta-agentによる委譲、実行中のフォーク、自動再試行インターフェースが、v0.3.0でそのまま利用できる機能ではないことも明記されている。