模型訓練與推理
DASH、推論軌跡に応じて蒸留重みを動的に配分——Qwen3の3モデル規模すべてで固定重みベースラインを上回る
DASHは、各tokenにおける教師—学生間の差異を一律に扱わず、生成軌跡全体に基づいて監督を前方へ伝播させる距離を調整する。著者らは3つの数学ベンチマークで安定した性能向上を報告し、訓練コード、評価パイプライン、LoRA重みも公開した。
Archive
技術ニュース 979 件
模型訓練與推理
DASHは、各tokenにおける教師—学生間の差異を一律に扱わず、生成軌跡全体に基づいて監督を前方へ伝播させる距離を調整する。著者らは3つの数学ベンチマークで安定した性能向上を報告し、訓練コード、評価パイプライン、LoRA重みも公開した。
Reasoning Core 用可執行評分器、難度控制與短答案格式產生數學、規劃、形式證明及程式題。匹配訓練實驗顯示它優於三套程序資料集,但作者也在外部資料庫發現生成器與評分器不一致。
AI 程式代理研究
新たな研究は、常設のAGENTS.mdと単一タスク向けのAgent Planを区別し、計画が公開バージョン履歴にどのように取り込まれるかを調査した。サンプルは少数のプロジェクトに大きく集中しており、「計画を協働成果物として扱う」実務が、依然として初期段階かつ不安定であることを示している。
AI 程式開發工具
Muse CodeはMuse Spark 1.2をターミナルエージェントとして提供し、隔離されたGit worktree内で大規模コードベースを並列処理できる。追記専用イベントログによりプロセス中断後も状態を再構築できるが、性能値は依然として主にMeta自身が提示したものだ。
AI 評測與安全
新たな評価手法は、MCPのツール一覧にセマンティック・デコイ、パラメータ・トラップ、能力の幻想などの指向性プローブを仕込み、誤った呼び出しからエージェントの選択上の弱点を特定する。11,520回の実験では、モデルの性能階層から安全性を安定して予測できないことが判明。また、誘導された後に自力で誤った経路から離脱できるかどうかによって、タスク成功率は16%から52%まで上昇した。
AI 代理與開發工具
Argusは長期タスクを制約付きのmissionに分割し、Manager、Planner、Engineer、Reviewerが共同で永続化可能な状態を維持する。著者らの報告では、tokenコストを1.41倍にすることでプログラム修復の成績を向上させたほか、エージェントが生成したRWKV6カーネルも外部からの修正を経てオープンソースプロジェクトにマージされた。
推論系統
ReCoは、推論の各ステップに対するプロセス報酬に基づいてKV cacheを動的に圧縮しつつ、反復的な振り返りを抑制して早期終了を行う。3つの推論モデルと6つのベンチマークを用いた著者らの実験では、生成token数が37%~65%減少し、レイテンシが2.08~2.35倍改善した。
代理評測
ContextWeaveは、エージェントが過去の情報を取り出せるかだけでなく、その記憶が後続の文書作成やオフィス業務を改善できるかを検証する。実験では、行動につながる完全な経験を保持する手法が短い要約を上回った一方、誤った記憶も実行結果に影響しやすくなることが示された。
AI 評測
MatrAIxは、相関する人口統計属性を組み合わせて83億件の模擬ユーザーを生成し、ペルソナエージェントにアンケート、チャットボット、Webサイト、アプリケーションを操作させる。チームは約100万件のコアデータと評価プログラムを公開したが、現時点の検証で示されているのは、エージェントが指定された役割に従うことだけであり、実ユーザーによるテストを代替できることまでは証明されていない。
AI 基礎設施
Microsoft Azureの研究により、エージェントがモデル推論、ツール、オーケストレーターの間を繰り返し切り替えることで、CPUが再びクリティカルパスに入り、その一方でGPUは頻繁にアイドル状態になることが示された。プロトタイプシステムのAgoraは、ワークフローの特性に応じて計算資源を回収できるが、並列エージェントへのGPU割り当てを誤って縮小すると、テールレイテンシがかえって16倍に悪化する。
模型訓練與程式碼 AI
OctoLongは、単一のライブラリをそのまま連結して長いテキストにするのではなく、AST、言語サーバー、パッケージの依存関係をたどって実装を再帰的に収集する。研究チームは600Mから14Bまでのモデルを公開し、実験では依存関係が密なデータによってコード検索、状態追跡、API利用が同時に改善された。
代理訓練與深度搜尋
ABSeekerは、検索エージェントの最終的な成否をステップ単位の報酬に分解し、失敗軌跡に含まれる有効なクエリを保持する一方、成功軌跡内の誤ったステップを抑制する。チームは4Bモデルの重み、推論・訓練パイプラインを公開しているが、最高スコアの達成には依然として追加のコンテキスト管理とLLMジャッジが必要だ。