AI 代理與評測
Bench2Robustが9種類のツール障害を注入、70組中69組のエージェントテストで性能が低下
Amazonの研究チームは、既存のツール使用ベンチマークを「再試行、切り替え、停止」を制御できる障害環境へと改造した。Qwen3-4Bに構造化された復旧情報を追加すると、障害下の小売タスクの合格率は最大16.8ポイント向上したが、解決不能なタスクで正しく棄権できるかは、まだ実際には検証されていない。
Archive
技術ニュース 975 件
AI 代理與評測
Amazonの研究チームは、既存のツール使用ベンチマークを「再試行、切り替え、停止」を制御できる障害環境へと改造した。Qwen3-4Bに構造化された復旧情報を追加すると、障害下の小売タスクの合格率は最大16.8ポイント向上したが、解決不能なタスクで正しく棄権できるかは、まだ実際には検証されていない。
AI 安全與開發平台
Anthropicは、2026年8月2日以降にリリースするClaudeモデルにモデル層のテキスト透かしを導入し、対応ファイルにはC2PA署名付きの来歴データを埋め込む。透かしが証明できるのは、コンテンツがClaudeによって処理された可能性に限られ、作品がAIによって新規生成されたことは証明できない。公開検出ツールや実測精度も、まだ公表されていない。
生成式影音與 3D
StateFlowは、オブジェクトのジオメトリ、姿勢、セマンティック状態、カメラを編集可能な3D世界として保存し、動画モデルには視覚的な仕上げを担わせる。30人による実験では動画プリビジュアライゼーションの総合評価が4.5/5に達したが、システムは複数のクローズドモデルに依存しており、コードもまだ公開されていない。
代理與評測研究
強いモデルから弱いモデルへのテスト時転移実験で、より強力なモデルが、重みを更新することなく固定された小型モデル向けにルーティング、フォーマット検査、決定論的ソルバーを実装した。最良の harness はベースラインの誤りの約83%を修正したが、その成績は規則としてコンパイル可能な心の理論ベンチマークに大きく依存している。
模型發布
Liquid AIは、31億パラメータのLFM2.5‑VL‑3Bを公開した。画面上の位置特定、レイアウトOCR、複数画像の理解、関数呼び出し機能を備える。公式測定ではApple M5 Maxで228 token/s、H100 1基での高並行スループットは約11,000 token/sを記録したが、データはまだ独立した再現検証を経ていない。
代理記憶
LoCoMoを用いた実験で、汎用的な要約は人物や出来事を保持する一方、日付、時刻、継続時間を選択的に失うことが判明した。時間的アンカーを原文どおり保持するよう明示すると、時系列問題に対する評価モデルの正解率は15.6%から47.0%に上昇した。
代理評測
CTBenchでは、エージェントが実機を模したインターフェースに問い合わせ、専門家が指定した証拠収集手順に沿って根本原因分析と経路復元を評価される。最良の組み合わせは経路復元精度を87.96%まで高めたものの、根本原因分析は47.62%にとどまり、取得できた重要な証拠も少なかった。
AI 數學與形式驗證
OEIS Openは、汎用言語モデルに固定予算内で492件の整数列予想を証明または反証させ、当初のSafeVerify評価では147件が合格した。別のLean検証器による再確認では144件となり、形式化ベンチマークが依然として仕様や検証器の違いに左右されることが浮き彫りになった。
代理評測
IBMのVAKRAは、API、ドキュメント検索、自然言語ポリシーを単一の実行可能な軌跡に統合する。最も高性能なモデルでも、APIインターフェース別の完全正答率は50%〜70.4%にとどまった。ポリシーによって回答不能となる問題では、一部モデルの成功率が2.4%まで低下した。
AI 代理/評測
Microsoft Researchなどのチームが、スキルあり・なしのペア軌跡を比較し、125件の機能的失敗と182件の効率低下事例を確認した。問題の多くはスキルとの関連性ではなく、エージェントが汎用的な例、検証チェックリスト、環境に関する前提をタスクの必須要件と誤認したことにある。
開放權重模型/本機推論
InclusionAIは、線形AttentionとスパースMoEを組み合わせた7.9BパラメータのLing‑3.0‑tinyを公開し、BF16、FP8、INT4の重みを提供している。公式によると、FP8はM4 Proで毎秒86〜90 tokenに達するが、vLLMとOllamaのサポートは現時点で上流の安定版に完全には取り込まれていない。
AI 評測與開發工具
DashArenaは、234件のオープンエンドなタスクを用いて、モデルが生成したインタラクティブなデータダッシュボードを評価し、モデル自身が記述した操作手順をブラウザ上で実際に再生する。インタラクションの証拠を加えると、8Bの視覚評価モデルと人間の選好との一致率は71.7%から79.8%に上昇したが、最良モデルでも完全再生率は73.3%にとどまった。