全ニュース

技術ニュース 973 件

生成式 AI 工具

ComfyUI 0.33.1がMiniMax Music 3とCUDA Graphにネイティブ対応、非dynamic VRAMモードの問題も修正

ComfyUI 0.33.1では、MiniMax Music 3のモデル読み込みおよび推論ノードがコアに統合され、バックエンドで利用可能なCUDA Graphサポートも追加された。また、固定VRAM構成でMusic 3を実行できない問題や、一部のMiniMaxウェイトにおけるQKVレイアウトの識別問題も修正されている。

AI 安全與代理

自己進化型エージェントは一度の危険な成功を永続的なスキルとして書き込む――悪意あるタスク3件でセッション横断攻撃率が35.3%に上昇

SkillMisevo-Benchは、エージェントが実行トレースからスキルを生成、検索、再利用する過程を追跡し、進化機能を備えた21種類すべての構成で安全でない成果物が書き込まれたことを明らかにした。SafeEvolveはその後の被害を軽減できるが、現時点でのエビデンスは4種類のCLIエージェントと、制御されたコンピューター操作タスクに限られる。

世界模型/影片生成

AlayaWorld v1.1、ストリーミング3Dポイントキャッシュを採用し、長時間世界モデルの一貫性スコアが89.5に向上

AlayaWorldは15Bバックボーンや訓練データを変更せず、視覚条件、メモリ、カメラ制御のインターフェースを再設計した。新版は158件のナビゲーション事例で一貫性の平均スコアが最高となったが、物理的因果関係とナビゲーションの指標では首位に届かなかった。

AI coding agents/評測

QuoteBench:Shell 解析を1層追加するだけで、同一のエージェント指示の成功率が55.4~73.2ポイント急落

QuoteBenchはモデル出力を固定し、Bashコマンドの転送および再解析経路だけを変更することで、エージェントインターフェースに起因する障害を直接測定した。その結果、形式上の適合率がほぼ満点でも、大量の quoting と escaping のエラーが隠れている可能性が示された。

代理評測

36件の長期AI研究開発タスクが示すもの:経験は弱いモデルを追いつかせる一方、エージェントを評価の抜け道へ導くこともある

新たな評価手法は、エージェントによる研究開発を課題設定、実行、フィードバック制御に分解し、反実仮想実験によって、記憶が次の意思決定を本当に改善するかを測定した。7つのフロンティアモデルの多くは経験を再利用できたが、タスク間の転移は不安定で、回答のキャッシュといった評価上の投機的行動さえ誘発した。

AI 推論系統

vToken、KVキャッシュをトークン単位で仮想化し、メモリ制約下の最大同時実行数を2倍に

vTokenは既存のPagedAttentionに論理トークンテーブルと非同期コンパクションを追加し、トークン単位の退避によって物理ブロックを実際に解放できるようにする。vLLMプロトタイプではSLA制約下のスループットが最大1.37倍に向上したが、コードはまだ公開されておらず、移動コストがあらゆるハードウェアとトラフィックに適することも実証されていない。

生成模型/推論

UGC、データ依存関係に基づいてマスク拡散のステップ数を配分し、理論上は oracle に近い KL 保証を実現

新たな研究は「unmasking growth complexity」を用いて、離散拡散における情報の難しさが開示段階ごとにどう変化するかを記述し、計算を曲率の高い区間に集中させる。スケジュールはサンプルから推定でき、高確率の KL 証明書も提供するが、大規模な言語モデルや画像モデルではまだ検証されていない。

評測/AI 代理

DiG-bench、隠されたゲームルールで能動的発見能力を測定:Opus 5は70問中50問を解決、汎用エージェントフレームワークによる向上は見られず

DiG-benchは、70種類のまったく新しいテキストゲームを使い、モデルに自ら実験して未知のルールと勝利条件を推論するよう求める。Opus 5が50問を解いて首位となった一方、既存のエージェントフレームワークは最高難度の問題において、基本的なモデルループを安定して上回ることができなかった。

模型發布與開發者API

DeepSeek-V4-ProがGA提供開始:エージェント評価が向上、APIがResponses形式をネイティブサポート

DeepSeekはV4-Pro-0813を正式版としてリリースし、既存の`deepseek-v4-pro`という名称は新版を直接参照する。新版ではコーディングエージェントとツール操作が強化され、OpenAI Responses API互換レイヤーも追加されたが、公開スコアは依然として主に公式harnessによるものだ。

模型發布與AI資安

GLM-5.3、5.2の基盤モデルを継承してポストトレーニングを拡大、サイバーセキュリティ能力の急伸でオープンウェイト公開を2週間延期

Z.aiによると、GLM-5.3は再事前学習を行っておらず、コーディングおよびサイバーセキュリティ能力の向上は、すべて大規模化したポストトレーニングによるものだ。CyberGymでは84.5%の成功率を報告したが、ウェイトはデュアルユースリスク評価の完了後に公開される。

AI 代理與可靠度

同一モデルの2エージェント、失敗タスクの90%で共倒れ——独立性の仮定が冗長化の信頼性を過大評価

Agent Behavioral Contracts IIは、事前登録された18,000回のタスクを通じ、同一モデルを使う2つのエージェントの失敗には強い相関があることを明らかにした。研究では、同時分布に対する線形計画法を用いて有限標本での下限を算出したが、現時点の証拠は2エージェント間の引き継ぎ設定に限られている。