代理訓練
SMRC-SD、エージェントの状態を照合してから成功軌跡を蒸留し、Qwen3-1.7Bのタスク成功率を約12ポイント向上
成功デモンストレーションは、エージェントが迂回して到達した状態に必ずしも適用できず、無条件に完全な軌跡を与えると、正しい行動の確率が下がることさえある。SMRC-SDは、状態とデモンストレーションのステップに互換性がある場合にのみ自己蒸留シグナルを追加し、ALFWorldとWebShopの双方で完全パスのベースラインを上回った。
Archive
技術ニュース 977 件
代理訓練
成功デモンストレーションは、エージェントが迂回して到達した状態に必ずしも適用できず、無条件に完全な軌跡を与えると、正しい行動の確率が下がることさえある。SMRC-SDは、状態とデモンストレーションのステップに互換性がある場合にのみ自己蒸留シグナルを追加し、ALFWorldとWebShopの双方で完全パスのベースラインを上回った。
評測與可重現性
新たな分析により、Google ERAはシーズン終了後に統合されたデータでバックテストを行い、CDCモデルの予測時点ではまだ利用できなかった改訂情報を事実上取得していたことが判明した。データがほとんど改訂されていない場合、両者のWISは同程度であり、AI予測ベンチマークでは各時点で利用可能だったデータのバージョンを保存する必要があることを示している。
代理基礎設施
KitesurfはRust、Wasm、モジュール式WebコンポーネントをCloudflare Workersに導入し、コンテンツ取得、フォーム操作、スクリーンショットなどのエージェント向けワークロードでブラウザのオーバーヘッドを削減する。公式テストでは、一部タスクのCPUおよびメモリ使用量が3分の1から7分の1になったとしているが、Webサイト互換性、ボット対策の認証、ソースコードの公開状況が依然として主な制約となっている。
代理安全/強化學習評估
HERALDは、同一問題に対する反事実編集を用いて検索エージェントの報酬を監査し、実在するものの取得されていない引用でも、ベースライン評価では元の軌跡以上のスコアを得られることを明らかにした。引用IDが取得済み集合に含まれるかを検査する引用—取得集合メンバーシップ検査を1項目追加すると、適格な593問で成功した攻撃は観測されなくなったが、この強化シグナルが現れたのは訓練軌跡のわずか0.03%だった。
模型發布/端側 AI
LFM2.5-2.6Bは、短い畳み込みとGQAを組み合わせたハイブリッドアーキテクチャにより、エージェント推論、ツール利用、長大なコンテキストをスマートフォンやパソコンにもたらす。公式測定ではM5 Max上で毎秒220トークンのデコード性能を記録したが、性能とエージェントベンチマークはいずれも主にベンダーによる自己評価に基づく。
代理訓練與檢索
CIPOは、最新の検索結果が見える場合と見えない場合のエージェントの行動確率を比較し、外部エビデンスの影響を受けた次のステップを直接評価する。著者らの実験では最強のベースラインを4.7 F1ポイント上回ったが、追加のスコアリングによって訓練コストが増加するうえ、現時点で検証されているのは2種類のQwen2.5モデルのみだ。
合成資料與醫療 AI 評測
Oracle Healthチームは、Synthea由来のケアギャップ・ベンチマークが既存の代理スコアを通過しても、極めて疎でテンプレート化されている可能性があることを明らかにした。決定論的な修正によって実用可能なデータの割合は改善したが、運用参照集団との平均差は9.70から30.69へ拡大し、内部的なリアリズムとソースへの忠実度を単一指標に統合できないことが示された。
模型訓練
u-OPSDは、同一モデルによる8本の推論軌跡から多数決で疑似解答を生成し、合意を条件とするtoken分布を意見が分かれた軌跡へ蒸留する。Qwen3-8Bの非思考モードにおける5ベンチマーク平均スコアは43.57から54.31へ上昇したが、誤った合意と複数回サンプリングのコストが依然として適用範囲を制限している。
模型推論與量化
BaKronは反対角線方向の並列化と再帰的な分割統治により、入力側と出力側の曲率情報を保持しながら、総計算量を4次から3次へ削減する。Llama 3 8Bを2.81-bitで量子化した実験ではGPTQよりパープレキシティが改善したが、全体の量子化時間は依然として長く、現時点で公開実装も確認されていない。
代理基礎設施
新たな研究により、埋め込み近傍で候補エッジを事前に制限すると、知識グラフが検索器では見つけられなかったスキルに到達できなくなることが判明した。BM25とベクトル検索の融合でも約4分の1のクエリは未解決だが、同じtoken予算ではグラフ近傍を上回った。
模型訓練與最佳化
Hyper-ESは、数十億次元のモデル重み上で直接ランダムな進化的探索を行うのではなく、少数のファインチューニング方向から部分空間を構成し、層ごとのモデルマージ係数を探索する。著者らは3つのモデルと6つの数学データセットで小幅な性能向上を報告しているが、この手法は完全な勾配フリーではない。
代理評測
FinEvo-Benchは、関連性はあるものの異なる金融ケースを交互に配置し、エージェントが過去のフィードバックを後続タスクで再利用可能な記憶やスキルへ変換できるかを検証する。4種類のエージェント・ラッパーはいずれも、タスクごとに状態をリセットする対照群を上回ったが、結果は単一の基盤モデルのみを使用したものだ。