全ニュース

技術ニュース 977 件

AI 代理/評測

SkillProx、エージェントスキルを検証して再収束――Qwen3.6-27Bの表タスク精度が54.5%に向上

SkillProxは、モデルが提案したスキル変更をそのまま採用するのではなく、タスクを再実行し、性能が低下したバージョンをロールバックしたうえで、効用が負の知識ユニットを削除する。3種類のQwenモデルはいずれも表タスクで性能が向上したが、著者らが現時点で公開しているのは、コミットが2件しかない実質的に空のリポジトリだけだ。

推論系統

CoBa、推論計算資源を動的に配分し、加重tokenを58.9%削減しながらBest-of-16に匹敵

CoBaはまず少数の回答候補を生成し、候補間の不一致度と検証スコアに応じて、追加サンプリングを行うか、より強力な検証器を有効にするかを決定する。5つの推論ベンチマークでマクロ平均正解率85.13%を達成したが、結果はオフラインの候補プールを用いたリプレイによるものであり、オンラインサービスでの実測ではない。

開放模型與端側推論

Meta、Muse Glimmer 30Bをオープン化:17GB量子化版とDFlashによりRTX 5090で233 token/sを達成

Muse Glimmerは、マルチモーダル入力、ツール呼び出し、失敗時の再試行を、コンシューマー向けハードウェアにデプロイ可能な30BのDenseモデルに統合した。Apache 2.0ライセンスの重みと公式GGUFはすでに公開されているが、性能および安全性の数値は現時点で主にMeta自身の評価に基づいている。

代理評測與可觀測性

A²E、23種類のベンチマークと9種類のエージェントシェルを統合、各評価セルは依然わずか5問

上海人工知能研究所がA²Eを公開した。Agent Task Protocolにより、ベンチマーク、エージェントシェル、軌跡評価を分離する。1,035回のペアリング実験から、シェルがツール使用とtokenコストに影響することが示された一方、サンプル数はフレームワークのランキングを裏付けるには不十分だ。

代理記憶研究

TEPA、期限切れのエージェントメモリを取り消し、反転タスクの成功率を21.0%から95.0%へ向上

TEPAは長期メモリに取り消し可能な有効状態を導入し、新たな証拠によって覆された内容を通常の検索対象から除外しながら、監査記録として保持する。この手法はシングルホップの矛盾を解消できる一方、マルチホップや262Kの長大なコンテキストではほぼ機能しない。

RAG 與金融 AI

FinRank、6,021件の紛らわしいパッセージで金融RAGを評価、7B埋め込みモデルのRecall@10はわずか44.8%

FinRankは、単に数値的に正しい回答を生成するだけでなく、企業、期間、開示文脈のすべてが正しい証拠をSEC文書から見つけるようシステムに要求する。データセットと評価コードは公開されているが、非商用ライセンスとアノテーション上の制約が採用方法に影響する。

評測與可重現性

Orcetra、自らAutoMLベンチマークの歪みを公表:同一サブセットでの勝率が59.4%から34.3%に低下

Orcetraは当初、513件のOpenMLデータセットでFLAMLとAutoGluonを大幅に上回ったと主張していたが、著者による監査でテストセットのリークと計算資源の不公平が判明した。プロトコル修正後、再実行したサブセットでは3システム間に統計的有意差は見られなかった。

醫療 AI 與代理訓練

ResidencyRL、最長60ターンの模擬問診で臨床エージェントを訓練――敵対的ケースの診断率が88%に向上

Googleのチームは、模擬患者、文書作成ツール、多次元の臨床報酬を組み合わせ、Gemini 3.5 Flashにマルチターン強化学習を実施した。モデルは敵対的な問診で危険な兆候の見落としを減らしたが、訓練システムはオープンソース化されておらず、実患者を対象とする前向き検証も完了していない。

模型訓練與最佳化

Muonはgrokkingを加速した後も破綻する:9つの設定すべてで汎化崩壊が発生

新たな実験により、Transformerの隠れ層行列をMuonで訓練し、埋め込みと出力ヘッドをAdamWで更新すると、モデルはモジュラー演算をより速く学習する一方、解法を安定して維持できないことが判明した。いずれかのパラメータ群を凍結すると崩壊を防げることから、問題は表現と読み出しインターフェースの同時ドリフトに起因するとみられる。

代理框架與可重現性

Shepherd v0.3.0はエージェントによる変更をレビュー可能な提案として保持するが、論文で示された自動フォーク監督はまだ完全には提供されていない

Shepherdはモデル呼び出し、ツール操作、ファイル変更を永続的な実行トレースとして記録し、変更がワークスペースに反映される前にユーザーが確認または破棄できるようにする。一方、最新のドキュメントでは、論文とプロジェクトのホームページで紹介されているmeta-agentによる委譲、実行中のフォーク、自動再試行インターフェースが、v0.3.0でそのまま利用できる機能ではないことも明記されている。