全ニュース

技術ニュース 979 件

模型訓練與推理

DASH、推論軌跡に応じて蒸留重みを動的に配分——Qwen3の3モデル規模すべてで固定重みベースラインを上回る

DASHは、各tokenにおける教師—学生間の差異を一律に扱わず、生成軌跡全体に基づいて監督を前方へ伝播させる距離を調整する。著者らは3つの数学ベンチマークで安定した性能向上を報告し、訓練コード、評価パイプライン、LoRA重みも公開した。

AI 程式代理研究

36,710件のGitHubプロジェクトから見つかったAgent Planはわずか85件、大半は長期保守される文書ではない

新たな研究は、常設のAGENTS.mdと単一タスク向けのAgent Planを区別し、計画が公開バージョン履歴にどのように取り込まれるかを調査した。サンプルは少数のプロジェクトに大きく集中しており、「計画を協働成果物として扱う」実務が、依然として初期段階かつ不安定であることを示している。

AI 程式開發工具

Meta、Muse Codeを発表:永続バックグラウンドエージェントとイベントログで長時間のコーディングタスクを支援

Muse CodeはMuse Spark 1.2をターミナルエージェントとして提供し、隔離されたGit worktree内で大規模コードベースを並列処理できる。追記専用イベントログによりプロセス中断後も状態を再構築できるが、性能値は依然として主にMeta自身が提示したものだ。

AI 評測與安全

Canary Tools、エージェントのツール選択ミスを6分類――8モデルの誘導されやすさに約36倍の差

新たな評価手法は、MCPのツール一覧にセマンティック・デコイ、パラメータ・トラップ、能力の幻想などの指向性プローブを仕込み、誤った呼び出しからエージェントの選択上の弱点を特定する。11,520回の実験では、モデルの性能階層から安全性を安定して予測できないことが判明。また、誘導された後に自力で誤った経路から離脱できるかどうかによって、タスク成功率は16%から52%まで上昇した。

AI 代理與開發工具

Argus、固定重みのエージェントに経験を蓄積させ、SWE-Bench Proの精度を59%から約78%へ向上

Argusは長期タスクを制約付きのmissionに分割し、Manager、Planner、Engineer、Reviewerが共同で永続化可能な状態を維持する。著者らの報告では、tokenコストを1.41倍にすることでプログラム修復の成績を向上させたほか、エージェントが生成したRWKV6カーネルも外部からの修正を経てオープンソースプロジェクトにマージされた。

推論系統

ReCo、ステップ報酬でKV cacheと推論長を協調制御し、エンドツーエンドのレイテンシを2倍超改善

ReCoは、推論の各ステップに対するプロセス報酬に基づいてKV cacheを動的に圧縮しつつ、反復的な振り返りを抑制して早期終了を行う。3つの推論モデルと6つのベンチマークを用いた著者らの実験では、生成token数が37%~65%減少し、レイテンシが2.08~2.35倍改善した。

代理評測

ContextWeave、1,000件超の実行可能なオフィスタスクでエージェント記憶を再評価、Preference Scoreは41.50から70.60へ

ContextWeaveは、エージェントが過去の情報を取り出せるかだけでなく、その記憶が後続の文書作成やオフィス業務を改善できるかを検証する。実験では、行動につながる完全な経験を保持する手法が短い要約を上回った一方、誤った記憶も実行結果に影響しやすくなることが示された。

AI 評測

MatrAIx、1,290次元の属性から83億のペルソナを合成、AI製品テスト向けの100万件規模のコアセットをオープンソース化

MatrAIxは、相関する人口統計属性を組み合わせて83億件の模擬ユーザーを生成し、ペルソナエージェントにアンケート、チャットボット、Webサイト、アプリケーションを操作させる。チームは約100万件のコアデータと評価プログラムを公開したが、現時点の検証で示されているのは、エージェントが指定された役割に従うことだけであり、実ユーザーによるテストを代替できることまでは証明されていない。

AI 基礎設施

Azureのエージェントワークフロー実測でCPU–GPUの断片化が明らかに、Agoraはアイドル計算資源を回収しつつテールレイテンシを維持

Microsoft Azureの研究により、エージェントがモデル推論、ツール、オーケストレーターの間を繰り返し切り替えることで、CPUが再びクリティカルパスに入り、その一方でGPUは頻繁にアイドル状態になることが示された。プロトタイプシステムのAgoraは、ワークフローの特性に応じて計算資源を回収できるが、並列エージェントへのGPU割り当てを誤って縮小すると、テールレイテンシがかえって16倍に悪化する。

模型訓練與程式碼 AI

OctoLong、ライブラリ横断の依存関係チェーンで長文脈モデルを訓練、8B版のRepoQAスコアが64.63に向上

OctoLongは、単一のライブラリをそのまま連結して長いテキストにするのではなく、AST、言語サーバー、パッケージの依存関係をたどって実装を再帰的に収集する。研究チームは600Mから14Bまでのモデルを公開し、実験では依存関係が密なデータによってコード検索、状態追跡、API利用が同時に改善された。

代理訓練與深度搜尋

ABSeeker、正解から検索手がかりを逆算し、4BモデルのBrowseCompスコアを55.3%に向上

ABSeekerは、検索エージェントの最終的な成否をステップ単位の報酬に分解し、失敗軌跡に含まれる有効なクエリを保持する一方、成功軌跡内の誤ったステップを抑制する。チームは4Bモデルの重み、推論・訓練パイプラインを公開しているが、最高スコアの達成には依然として追加のコンテキスト管理とLLMジャッジが必要だ。