全ニュース

技術ニュース 970 件

AI 代理與評測

Thinkingbox、バックエンド状態で507件の企業ワークフローを検証――最良のエージェントでも20回連続全問正解は25.25%

MicrosoftがThinkingboxをオープンソース化した。隔離されたMCPツール環境と実行可能なアサーションを使い、応答内容やツール呼び出しの正当性だけでなく、エージェントが実際に作業を完了したかを検証する。最良のシステムは単発成功率65.36%を記録したが、同一タスクで20回連続の成功を求めると25.25%にとどまった。

推論系統

ReCache、ツールschemaを再利用可能なKVブロックに分割し、割り当てメモリを92.43%削減

ReCacheは注意機構と位置エンコーディングを改変し、リクエスト間で個々のツールやスキルのKV cacheを再利用できるようにする。Qwen3の実験ではTime to First Token(TTFT)が最大3.655倍高速化したが、モデルのfine-tuningが必要であり、そのまま適用できる推論プラグインではない。

AI 推論系統

FlashPrefill V2がブロック疎注意機構をSGLangに統合、128KプリフィルのTTFTを最大4.8倍短縮

Tencent WeChatと中国科学院のチームがHopper向け疎注意機構カーネルを書き直し、FP8、paged KV cache、continuous batching、枝刈りされたブロックの平均値補償を追加した。H20でのテストでは演算子単体で最大47.26倍の高速化を達成したが、エンドツーエンドの効果はそれより小さく、現時点での統合はプロジェクトに同梱されたSGLangブランチに依存している。

AI 可解釋性研究

Forking Fast、変化点検出で推論の分岐を再構成——解析用token予算を8分の1に削減可能

新手法は推論結果の分布を区分的に滑らかな系列として捉え、PELTで真の意思決定点を特定したうえで、Dirichletカーネルプーリングによりサンプリングノイズを抑制する。2つの8Bモデルを用いた実験では再サンプリングを大幅に削減できることが示されたが、現時点で結論が適用されるのはtinyMMLUの選択式問題に限られる。

機器人/VLA 訓練

EXIMO、VLMオーケストレーションによる探索を3B VLAへ再蒸留し、追加の遠隔操作デモを不要に

Google DeepMindは、視覚言語モデルに長い手順を要するロボットタスクをVLAが実行可能なサブゴールへ分解させ、成功軌跡で元のモデルをファインチューニングしたうえで、残差型オフポリシー強化学習を追加した。この手法はシミュレーションタスクの探索効率を向上させたが、実ロボットで人間によるデモを代替できることはまだ実証されていない。

代理訓練/開源框架

EnvHarness、検証器を変更せずにエージェント訓練環境を再構成、ALFWorldのドメイン外性能を9ポイント向上

Google Cloud AI Researchなどのチームは、エージェントharnessの概念を環境側に適用し、組み合わせ可能なインターフェース層によって初期状態、可視情報、タスクフローを変更する手法を開発した。オープンソースの実験は5つのベンチマークを対象とし、最大9パーセントポイントの向上を達成したが、完全な結果の再現には複数の外部環境と商用モデルAPIが依然として必要となる。

AI 開發工具

NVIDIA、CUDA MCPとセルフホスト型Nsight Blueprintを発表—4モデル構成のバックエンドを社内ネットワーク内で運用可能に

Nsight AIは、リアルタイムのCUDAドキュメントをCodexやClaudeなどのMCPクライアントに接続できるようになったほか、完全なコーディング支援バックエンドをローカル環境にデプロイできるようになった。オープンソースのBlueprintは、生成、補完、埋め込み、リランキングの各モデルを組み合わせるが、リファレンス構成にはHopper世代のGPUと少なくとも200GBのストレージが必要となる。

開放模型

Ornith-1.5、自己生成したタスクを強化学習に組み込み、397BモデルがTerminal-Bench 2.1で86.1点と自己報告

Ornithは、9B、35B MoE、397B MoEの3種類のオープンウェイトモデルを公開した。訓練ループでは、タスク、エージェント・スキャフォールド、解答軌跡を同時に最適化する。397Bモデルのコーディングエージェント性能はクローズドなフロンティアモデルに迫るが、数値はまだ独立に再現されておらず、モデルの公開文書にはライセンス上の不備もある。

代理平台

Claude、computer use、Skills API、Files APIをGA化、ブラウザエージェントは要素単位の制御へ

Anthropicの新しいツールでは、1回のモデルターンで複数のインターフェース操作を実行でき、ページ構造、バージョン管理可能なスキル、永続ファイルも組み合わせられる。既存のbeta統合は引き続き動作するが、computer useツールをアップグレードするとリクエスト形式が変わるほか、エンジニアリングチームはブラウザの分離やプロンプトインジェクションのリスクにも自ら対処する必要がある。

代理評測

NVIDIA AVO、ARC-AGI-3公開セット全183レベルをクリア、アクション数はVISTA比で約12%減

NVIDIAは、もともとGPUカーネルの進化的探索に用いていたAVOエージェントアーキテクチャを対話型推論へ移植し、Claude Opus 5との組み合わせで100.00 RHAEを達成した。この結果は、エージェントのメモリと検証ループによって同じモデルの性能が大きく変わり得ることを示している。ただし、対象は公開環境に限られており、VISTAとの比較も統制されたアブレーションではない。