全ニュース

技術ニュース 977 件

代理訓練

SMRC-SD、エージェントの状態を照合してから成功軌跡を蒸留し、Qwen3-1.7Bのタスク成功率を約12ポイント向上

成功デモンストレーションは、エージェントが迂回して到達した状態に必ずしも適用できず、無条件に完全な軌跡を与えると、正しい行動の確率が下がることさえある。SMRC-SDは、状態とデモンストレーションのステップに互換性がある場合にのみ自己蒸留シグナルを追加し、ALFWorldとWebShopの双方で完全パスのベースラインを上回った。

評測與可重現性

ERAのパンデミック予測における後ろ向き評価の11%優位を再検証、データ改訂の漏洩で改善のほぼすべてを説明可能

新たな分析により、Google ERAはシーズン終了後に統合されたデータでバックテストを行い、CDCモデルの予測時点ではまだ利用できなかった改訂情報を事実上取得していたことが判明した。データがほとんど改訂されていない場合、両者のWISは同程度であり、AI予測ベンチマークでは各時点で利用可能だったデータのバージョンを保存する必要があることを示している。

代理基礎設施

Cloudflare、Kitesurfを発表:軽量WebエンジンでChromiumを置き換え、エージェント型ブラウジングのリソース使用量を約3分の1以下に

KitesurfはRust、Wasm、モジュール式WebコンポーネントをCloudflare Workersに導入し、コンテンツ取得、フォーム操作、スクリーンショットなどのエージェント向けワークロードでブラウザのオーバーヘッドを削減する。公式テストでは、一部タスクのCPUおよびメモリ使用量が3分の1から7分の1になったとしているが、Webサイト互換性、ボット対策の認証、ソースコードの公開状況が依然として主な制約となっている。

代理安全/強化學習評估

HERALD、検索エージェントが未取得のパッセージを引用できる問題を暴露――単一のメンバーシップ検査で実測攻撃成功率をゼロに

HERALDは、同一問題に対する反事実編集を用いて検索エージェントの報酬を監査し、実在するものの取得されていない引用でも、ベースライン評価では元の軌跡以上のスコアを得られることを明らかにした。引用IDが取得済み集合に含まれるかを検査する引用—取得集合メンバーシップ検査を1項目追加すると、適格な593問で成功した攻撃は観測されなくなったが、この強化シグナルが現れたのは訓練軌跡のわずか0.03%だった。

模型發布/端側 AI

Liquid AI、LFM2.5-2.6Bの重みを公開――2.69Bのオンデバイスモデルが128Kコンテキストとツール呼び出しに対応

LFM2.5-2.6Bは、短い畳み込みとGQAを組み合わせたハイブリッドアーキテクチャにより、エージェント推論、ツール利用、長大なコンテキストをスマートフォンやパソコンにもたらす。公式測定ではM5 Max上で毎秒220トークンのデコード性能を記録したが、性能とエージェントベンチマークはいずれも主にベンダーによる自己評価に基づく。

代理訓練與檢索

CIPO、検索エビデンスをマスクしてステップ報酬を割り当て、Qwen2.5-7Bの7つのQAタスクにおける平均F1を0.504に向上

CIPOは、最新の検索結果が見える場合と見えない場合のエージェントの行動確率を比較し、外部エビデンスの影響を受けた次のステップを直接評価する。著者らの実験では最強のベースラインを4.7 F1ポイント上回ったが、追加のスコアリングによって訓練コストが増加するうえ、現時点で検証されているのは2種類のQwen2.5モデルのみだ。

合成資料與醫療 AI 評測

合成臨床データは有用性の基準を満たしても79.44%が欠損し得る一方、2つの修正でソース分布との差は拡大

Oracle Healthチームは、Synthea由来のケアギャップ・ベンチマークが既存の代理スコアを通過しても、極めて疎でテンプレート化されている可能性があることを明らかにした。決定論的な修正によって実用可能なデータの割合は改善したが、運用参照集団との平均差は9.70から30.69へ拡大し、内部的なリアリズムとソースへの忠実度を単一指標に統合できないことが示された。

模型訓練

u-OPSD、モデル内部の投票だけで学習し、Qwen3-8Bの数学5ベンチマーク平均を10.7ポイント向上

u-OPSDは、同一モデルによる8本の推論軌跡から多数決で疑似解答を生成し、合意を条件とするtoken分布を意見が分かれた軌跡へ蒸留する。Qwen3-8Bの非思考モードにおける5ベンチマーク平均スコアは43.57から54.31へ上昇したが、誤った合意と複数回サンプリングのコストが依然として適用範囲を制限している。

模型推論與量化

BaKron、両側 Hessian 量子化を3次計算量に削減――8192次正方行列カーネルでYAQAの60倍高速

BaKronは反対角線方向の並列化と再帰的な分割統治により、入力側と出力側の曲率情報を保持しながら、総計算量を4次から3次へ削減する。Llama 3 8Bを2.81-bitで量子化した実験ではGPTQよりパープレキシティが改善したが、全体の量子化時間は依然として長く、現時点で公開実装も確認されていない。

代理基礎設施

690件のエージェントスキルを実測:ハイブリッド検索のhit@5は73.5%、LLM知識グラフの追加で11.2ポイント低下

新たな研究により、埋め込み近傍で候補エッジを事前に制限すると、知識グラフが検索器では見つけられなかったスキルに到達できなくなることが判明した。BM25とベクトル検索の融合でも約4分の1のクエリは未解決だが、同じtoken予算ではグラフ近傍を上回った。

模型訓練與最佳化

Hyper-ES、勾配で低次元探索空間を構築し、数学的推論でGRPO-LoRAを平均1%上回る

Hyper-ESは、数十億次元のモデル重み上で直接ランダムな進化的探索を行うのではなく、少数のファインチューニング方向から部分空間を構成し、層ごとのモデルマージ係数を探索する。著者らは3つのモデルと6つの数学データセットで小幅な性能向上を報告しているが、この手法は完全な勾配フリーではない。

代理評測

FinEvo-Bench、120の金融タスクでエージェントのタスク横断的進化を測定、Codexはペア比較で19.37ポイント向上

FinEvo-Benchは、関連性はあるものの異なる金融ケースを交互に配置し、エージェントが過去のフィードバックを後続タスクで再利用可能な記憶やスキルへ変換できるかを検証する。4種類のエージェント・ラッパーはいずれも、タスクごとに状態をリセットする対照群を上回ったが、結果は単一の基盤モデルのみを使用したものだ。