AI 代理與評測
Thinkingbox、バックエンド状態で507件の企業ワークフローを検証――最良のエージェントでも20回連続全問正解は25.25%
MicrosoftがThinkingboxをオープンソース化した。隔離されたMCPツール環境と実行可能なアサーションを使い、応答内容やツール呼び出しの正当性だけでなく、エージェントが実際に作業を完了したかを検証する。最良のシステムは単発成功率65.36%を記録したが、同一タスクで20回連続の成功を求めると25.25%にとどまった。
Archive
技術ニュース 970 件
AI 代理與評測
MicrosoftがThinkingboxをオープンソース化した。隔離されたMCPツール環境と実行可能なアサーションを使い、応答内容やツール呼び出しの正当性だけでなく、エージェントが実際に作業を完了したかを検証する。最良のシステムは単発成功率65.36%を記録したが、同一タスクで20回連続の成功を求めると25.25%にとどまった。
Task-CoEvolveは、候補harness間の過去の差異に基づいて検証タスクを動的に選択し、抽出確率を用いて全体スコアを推定する。Terminal-Bench 2.1では全量探索に近い性能を示したが、論文では探索と評価に同一のタスク群を使用しており、コードもまだ実際には公開されていない。
推論系統
新手法により、モデルは微調整時にH2OなどのKV eviction戦略へ直接適応できる。128Kタスクの一部では、約20%〜64%だった精度が90%超に向上した。ただし、自然言語質問応答で常に優位なわけではなく、オープンソース実装も依然として研究用ツールと位置付けられている。
推論系統
ReCacheは注意機構と位置エンコーディングを改変し、リクエスト間で個々のツールやスキルのKV cacheを再利用できるようにする。Qwen3の実験ではTime to First Token(TTFT)が最大3.655倍高速化したが、モデルのfine-tuningが必要であり、そのまま適用できる推論プラグインではない。
AI 推論系統
Tencent WeChatと中国科学院のチームがHopper向け疎注意機構カーネルを書き直し、FP8、paged KV cache、continuous batching、枝刈りされたブロックの平均値補償を追加した。H20でのテストでは演算子単体で最大47.26倍の高速化を達成したが、エンドツーエンドの効果はそれより小さく、現時点での統合はプロジェクトに同梱されたSGLangブランチに依存している。
AI 可解釋性研究
新手法は推論結果の分布を区分的に滑らかな系列として捉え、PELTで真の意思決定点を特定したうえで、Dirichletカーネルプーリングによりサンプリングノイズを抑制する。2つの8Bモデルを用いた実験では再サンプリングを大幅に削減できることが示されたが、現時点で結論が適用されるのはtinyMMLUの選択式問題に限られる。
機器人/VLA 訓練
Google DeepMindは、視覚言語モデルに長い手順を要するロボットタスクをVLAが実行可能なサブゴールへ分解させ、成功軌跡で元のモデルをファインチューニングしたうえで、残差型オフポリシー強化学習を追加した。この手法はシミュレーションタスクの探索効率を向上させたが、実ロボットで人間によるデモを代替できることはまだ実証されていない。
代理訓練/開源框架
Google Cloud AI Researchなどのチームは、エージェントharnessの概念を環境側に適用し、組み合わせ可能なインターフェース層によって初期状態、可視情報、タスクフローを変更する手法を開発した。オープンソースの実験は5つのベンチマークを対象とし、最大9パーセントポイントの向上を達成したが、完全な結果の再現には複数の外部環境と商用モデルAPIが依然として必要となる。
AI 開發工具
Nsight AIは、リアルタイムのCUDAドキュメントをCodexやClaudeなどのMCPクライアントに接続できるようになったほか、完全なコーディング支援バックエンドをローカル環境にデプロイできるようになった。オープンソースのBlueprintは、生成、補完、埋め込み、リランキングの各モデルを組み合わせるが、リファレンス構成にはHopper世代のGPUと少なくとも200GBのストレージが必要となる。
開放模型
Ornithは、9B、35B MoE、397B MoEの3種類のオープンウェイトモデルを公開した。訓練ループでは、タスク、エージェント・スキャフォールド、解答軌跡を同時に最適化する。397Bモデルのコーディングエージェント性能はクローズドなフロンティアモデルに迫るが、数値はまだ独立に再現されておらず、モデルの公開文書にはライセンス上の不備もある。
代理平台
Anthropicの新しいツールでは、1回のモデルターンで複数のインターフェース操作を実行でき、ページ構造、バージョン管理可能なスキル、永続ファイルも組み合わせられる。既存のbeta統合は引き続き動作するが、computer useツールをアップグレードするとリクエスト形式が変わるほか、エンジニアリングチームはブラウザの分離やプロンプトインジェクションのリスクにも自ら対処する必要がある。
代理評測
NVIDIAは、もともとGPUカーネルの進化的探索に用いていたAVOエージェントアーキテクチャを対話型推論へ移植し、Claude Opus 5との組み合わせで100.00 RHAEを達成した。この結果は、エージェントのメモリと検証ループによって同じモデルの性能が大きく変わり得ることを示している。ただし、対象は公開環境に限られており、VISTAとの比較も統制されたアブレーションではない。