全ニュース

技術ニュース 975 件

AI 代理與評測

Bench2Robustが9種類のツール障害を注入、70組中69組のエージェントテストで性能が低下

Amazonの研究チームは、既存のツール使用ベンチマークを「再試行、切り替え、停止」を制御できる障害環境へと改造した。Qwen3-4Bに構造化された復旧情報を追加すると、障害下の小売タスクの合格率は最大16.8ポイント向上したが、解決不能なタスクで正しく棄権できるかは、まだ実際には検証されていない。

AI 安全與開發平台

Claudeの新モデル、生成プロセスにテキスト透かしを組み込み——APIとClaude Codeも例外ではない

Anthropicは、2026年8月2日以降にリリースするClaudeモデルにモデル層のテキスト透かしを導入し、対応ファイルにはC2PA署名付きの来歴データを埋め込む。透かしが証明できるのは、コンテンツがClaudeによって処理された可能性に限られ、作品がAIによって新規生成されたことは証明できない。公開検出ツールや実測精度も、まだ公表されていない。

生成式影音與 3D

StateFlow、ショットごとの再生成を永続的な3D状態に置き換え、動画プリビジュアライゼーションのユーザー評価で4.5/5を獲得

StateFlowは、オブジェクトのジオメトリ、姿勢、セマンティック状態、カメラを編集可能な3D世界として保存し、動画モデルには視覚的な仕上げを担わせる。30人による実験では動画プリビジュアライゼーションの総合評価が4.5/5に達したが、システムは複数のクローズドモデルに依存しており、コードもまだ公開されていない。

代理與評測研究

強力なモデルがタスク規則を harness にコンパイル、GPT‑5.4‑mini の正解率が0.488から0.912に向上

強いモデルから弱いモデルへのテスト時転移実験で、より強力なモデルが、重みを更新することなく固定された小型モデル向けにルーティング、フォーマット検査、決定論的ソルバーを実装した。最良の harness はベースラインの誤りの約83%を修正したが、その成績は規則としてコンパイル可能な心の理論ベンチマークに大きく依存している。

模型發布

LFM2.5‑VL‑3B、約3GBのメモリで視覚モデルを実行、vLLM、llama.cpp、MLXをネイティブサポート

Liquid AIは、31億パラメータのLFM2.5‑VL‑3Bを公開した。画面上の位置特定、レイアウトOCR、複数画像の理解、関数呼び出し機能を備える。公式測定ではApple M5 Maxで228 token/s、H100 1基での高並行スループットは約11,000 token/sを記録したが、データはまだ独立した再現検証を経ていない。

代理記憶

長期記憶の要約が保持した時間表現はわずか3.05%、一文のプロンプトで時系列QAの正解率が31.4ポイント向上

LoCoMoを用いた実験で、汎用的な要約は人物や出来事を保持する一方、日付、時刻、継続時間を選択的に失うことが判明した。時間的アンカーを原文どおり保持するよう明示すると、時系列問題に対する評価モデルの正解率は15.6%から47.0%に上昇した。

代理評測

CTBench、234件の通信障害サンドボックスでエージェントを再評価――最高の根本原因分析精度でも47.62%にとどまる

CTBenchでは、エージェントが実機を模したインターフェースに問い合わせ、専門家が指定した証拠収集手順に沿って根本原因分析と経路復元を評価される。最良の組み合わせは経路復元精度を87.96%まで高めたものの、根本原因分析は47.62%にとどまり、取得できた重要な証拠も少なかった。

AI 數學與形式驗證

OEIS Open、Leanで492件の未解決予想を検証——クロスチェックで合格数を147件から144件に訂正

OEIS Openは、汎用言語モデルに固定予算内で492件の整数列予想を証明または反証させ、当初のSafeVerify評価では147件が合格した。別のLean検証器による再確認では144件となり、形式化ベンチマークが依然として仕様や検証器の違いに左右されることが浮き彫りになった。

代理評測

VAKRAが8,000超のローカルAPIを再実行、エージェントの精度はマルチホップとポリシー制約で急落

IBMのVAKRAは、API、ドキュメント検索、自然言語ポリシーを単一の実行可能な軌跡に統合する。最も高性能なモデルでも、APIインターフェース別の完全正答率は50%〜70.4%にとどまった。ポリシーによって回答不能となる問題では、一部モデルの成功率が2.4%まで低下した。

AI 代理/評測

関連スキルもエージェントの足を引っ張る可能性:307件の失敗事例、その多くは誤実装と過剰な検証に起因

Microsoft Researchなどのチームが、スキルあり・なしのペア軌跡を比較し、125件の機能的失敗と182件の効率低下事例を確認した。問題の多くはスキルとの関連性ではなく、エージェントが汎用的な例、検証チェックリスト、環境に関する前提をタスクの必須要件と誤認したことにある。

開放權重模型/本機推論

Ling‑3.0‑tinyは各tokenで有効化するパラメータがわずか1.3Bだが、ローカル実行には依然として専用runtimeブランチが必要

InclusionAIは、線形AttentionとスパースMoEを組み合わせた7.9BパラメータのLing‑3.0‑tinyを公開し、BF16、FP8、INT4の重みを提供している。公式によると、FP8はM4 Proで毎秒86〜90 tokenに達するが、vLLMとOllamaのサポートは現時点で上流の安定版に完全には取り込まれていない。

AI 評測與開發工具

DashArena、モデルに再生可能な操作トレースの添付を要求 ダッシュボードの「表示できるが使えない」ギャップを可視化

DashArenaは、234件のオープンエンドなタスクを用いて、モデルが生成したインタラクティブなデータダッシュボードを評価し、モデル自身が記述した操作手順をブラウザ上で実際に再生する。インタラクションの証拠を加えると、8Bの視覚評価モデルと人間の選好との一致率は71.7%から79.8%に上昇したが、最良モデルでも完全再生率は73.3%にとどまった。