全ニュース

技術ニュース 973 件

AI 評測與代理系統

3つのエージェント・ベンチマークでモデルの主効果は3%未満、DDRがランキングをデプロイ信頼性の問題へと再定義

新たな研究が一般化可能性理論を用いて TheAgentCompany、τ²-bench、AppWorld を分解した結果、エージェントとタスクの交互作用が、エージェント自体の平均的な差を大きく上回ることが分かった。著者らは DDR レポーティング・フレームワークを提案し、選定時にタスク難易度、ホールドアウト検証、コスト、必要サンプル数を併せて報告するよう求めている。

AI 代理與基礎設施

LLMエージェントがHPCジョブを異種クラスターへ投入、記述的なハードウェアデータで成功率が48%から87%に向上

LLNLのチームは、エージェントにFlux、Slurm、Kubernetesなどのリソースを探索させ、高レベルの意図を検証可能なジョブ仕様へ変換した。6つのクラウドクラスターでの実験から、アーキテクチャ、ネットワーク、メモリのmetadataは、実行不能なマシンの除外には主に役立つものの、安定した性能オプティマイザーではないことが示された。

AI 評測與開發工具

GSR、採点ルールを型付きグラフにコンパイルし、LLMジャッジの完全スコア一致率を最大6.75ポイント向上

Graph-Structured Rubricsは、評価対象の回答を見る前に、自然言語のrubricを型付きの判定、変換、集約、ゲートノードへコンパイルする。GPT‑OSS‑120Bを用いた実験では、フラットなPrometheus方式の採点を上回ったが、現時点で実装コードは公開されておらず、改善幅もデータセットに大きく依存する。

開放模型與影音生成

MiniMax H3、33Bのベースウェイトを公開――映像とステレオ音声をネイティブに同期生成

MiniMax H3は、単一のTransformerで映像と音声のlatentを共同予測し、テキスト、開始・終了フレーム、マルチモーダル参照からの生成に対応する。公開版はローカルで768pの映像・音声を生成できるが、公式の2Kワークフローは依然として、オープンソース化されていない2つのクラウドモジュールに依存している。

AI 程式代理/評測

Harness‑IF、「もともとできる」ことと真の指示遵守を分離──12種類のコーディングエージェントで最大7.4ポイント差

Harness‑IFは、ルールをシステムプロンプト、プロジェクトファイル、ユーザー指示、ツール記述、スキル記述に分散させ、実際の実行証拠に基づいて一つずつ評価する。12種類の最先端モデルはいずれも、自身のデフォルト傾向に反するルールに直面すると正確率が低下した。

AI 安全/程式分析

VICBench、100件の脆弱性が初めて導入されたコミットを追跡――既存の自動手法は最高でもF1 40.1%

VICBenchは、人手とエージェントによる二重追跡を通じて、Python、Java、C++プロジェクトにおける100件のCVEのvulnerability-inducing commitをアノテーションした。ファイルをまたぐコード移動やリファクタリングにより、V-SZZとLLM4SZZでは多数の誤判定が生じ、影響を受けるバージョンに関するデータの信頼性にも問題があることが明らかになった。

生成式影片與開放模型

LTX‑2.5、拡散デコーダーと単一パスのマルチショット生成でオープン動画モデルを更新

LTX‑2.5は、学習可能な22Bモデルと8ステップ蒸留モデルの重みを公開し、ショットをまたぐキャラクター、音声、シーンの一貫性を追加した。完全なクイックスタート用コンポーネントは約66 GiBで、Diffusers対応には依然としてmainブランチのインストールが必要だ。また、モデルには売上高基準のコミュニティライセンスによる制限もある。

開放模型與推論基礎設施

Qwen3.8、Max級として初めて2.4Tパラメータの重みを公開、各tokenで95Bを有効化

AlibabaのQwenがQwen3.8‑2.4T‑A95Bを公開した。512のエキスパートと、線形Attentionおよび標準Attentionのハイブリッド構成により、最長約101万tokenに対応する。推論深度は調整できるものの、入力はテキストのみで、思考モードを無効化できない。実際のデプロイ要件は、一般的なオープンウェイトモデルをはるかに上回る。

模型評測與推論

同一モデルでもtoken上限によって順位が逆転、4モデルで56,476回の推論を実施

新たな研究で、4つのオープンウェイトモデルの生成上限を64から4,096 tokenまで引き上げたところ、3つの推論ベンチマークすべてで首位モデルが入れ替わった。打ち切られた出力を除外しても、予算を増やした際に正解から不正解へ転じた問題が3~19%あり、単一のtoken設定だけではデプロイするモデルを十分に選定できないことが示された。

AI 代理與評測

Bench2Robustが9種類のツール障害を注入、70組中69組のエージェントテストで性能が低下

Amazonの研究チームは、既存のツール使用ベンチマークを「再試行、切り替え、停止」を制御できる障害環境へと改造した。Qwen3-4Bに構造化された復旧情報を追加すると、障害下の小売タスクの合格率は最大16.8ポイント向上したが、解決不能なタスクで正しく棄権できるかは、まだ実際には検証されていない。

AI 安全與開發平台

Claudeの新モデル、生成プロセスにテキスト透かしを組み込み——APIとClaude Codeも例外ではない

Anthropicは、2026年8月2日以降にリリースするClaudeモデルにモデル層のテキスト透かしを導入し、対応ファイルにはC2PA署名付きの来歴データを埋め込む。透かしが証明できるのは、コンテンツがClaudeによって処理された可能性に限られ、作品がAIによって新規生成されたことは証明できない。公開検出ツールや実測精度も、まだ公表されていない。