全ニュース

技術ニュース 977 件

模型架構與推論

Matryoshka、3種類のモデルを単一の重みに内包し、学習計算量を36%削減

Matryoshka Language Model Suitesは、500M、1.5B、3Bのサブモデルを個別に切り出せる入れ子構造として連結し、サイズごとの重複学習を回避する。前段の層とKVキャッシュを共有することで、投機的デコーディングのスループットも14%から26%向上するが、現時点で検証されているのは3B級の基盤モデルに限られる。

AI 程式驗證

P³、プログラムと証明を事前に共同設計し、Leanの問題解決率を4.6~11.2ポイント向上

P³は、エージェントがコードを書く前に、実装構造、補助補題、証明の分解方法を共同で計画し、実装後に証明を繰り返し修正する事態を防ぐ。3つのLean 4ベンチマークにおける全モデル構成で比較対象のワークフローを上回ったが、最難関のリポジトリタスクでは、最高でも22.2%しか解決できなかった。

AI 硬體設計

ArchAgent v2、エージェント進化で3層プリフェッチャを設計、DPC4シミュレーション性能で人間設計の王者をわずかに上回る

ArchAgent v2はL1D、L2、LLCの各プリフェッチャを段階的に進化させ、リアルタイムの容量チェックによってハードウェア予算を超える候補を排除する。最終設計はDPC4シミュレーション環境で人間設計の王者BertiGOを0.3%上回ったが、実チップではまだ検証されていない。

AI 編程與評測

SWE-Bench ProMax、リファクタリング評価を7言語に拡大—最高性能のエージェントでも解決率は41.2%

SWE-Bench ProMaxは、29,782件の候補コミットから複数ファイルにまたがる170件のリファクタリングタスクを選定し、専門家が要件を書き直してテストを検証した。GPT‑5.2とOpenHandsの組み合わせが最高の解決率を記録したものの、実行軌跡からは、エージェントが周辺の呼び出し箇所や設定、テストファイルの変更を見落としがちであることが分かった。

推論系統與評測

KVDiagnosis、KVキャッシュ圧縮の失敗をサンプル単位で追跡し、正解から不正解に転じた12,520件の事例を公開

KVDiagnosisは長文コンテキストの総合スコアを比較するだけでなく、各圧縮設定についてFullCacheとのペアを作成し、エビデンスの保持、アテンション、確率のドリフトを追跡する。チームは実装監査により、結果が完全に一致していたPyramidKVの7,800組の記録も除外し、手法横断の評価がアダプターの不具合によって容易に汚染され得ることを浮き彫りにした。

AI 安全與代理框架

SHE、エージェントの実行軌跡から安全ハーネスを書き換え、攻撃成功率を17.1%から5.5%に低減

SHEはエージェントの安全ハーネスをシステムプロンプト、ルールベース、安全メモリ、ツールポリシーに分解し、失敗軌跡に基づいて局所的に改訂する。Agent-SafetyBenchでは攻撃成功率と誤拒否率を同時に低減したが、実環境への導入では評価器のバイアスやルールの自己肥大化を防ぐ必要がある。

AI 安全與內容來源

Anthropic、新Claudeの出力にモデルレベルのテキスト透かしを導入、ファイルにはC2PA署名を採用

Anthropicによると、8月2日以降に提供されるClaudeモデルは、テキストに不可視のマーカーを埋め込み、対応する画像や文書には署名付きの来歴データを付与する。技術仕様と第三者向け検出ツールはまだ公開されておらず、現時点でこのマーカーを生成元の完全な証明とみなすことはできない。

模型安全研究

拡散型LLMの安全ニューロンはアーキテクチャをまたいで転移可能、プルーニングで拒否回避率が86.6%に上昇

新たな研究によると、自己回帰モデルを基に改造された拡散型LLMは、少数のニューロンに集中した安全機構も引き継いでいる可能性がある。研究者らはオープンな拡散モデルを使って攻撃プロンプトをオフライン生成したが、公開を約束している完全なコードはまだリリースされていない。

開發者平台

OpenAIが`gpt-5.2-chat-latest`を終了、移行はモデル名の置き換えだけでは不十分

OpenAIは8月10日にAPIの`gpt-5.2-chat-latest`を終了し、公式にはGPT‑5.5への移行を推奨している。今回廃止されるのはChatGPTの挙動に追随するエイリアスであり、エンジニアリングチームはプロンプト、ツール呼び出し、出力形式を改めて検証する必要がある。移行を同等なルーティングの切り替えと見なすことはできない。

推論系統

Laguna S 2.1 INT4とDFlashを組み合わせ、RTX 3090×4枚で200Kコンテキストと最大282.5 token/sを実測

コミュニティが再現可能なvLLMレシピを公開した。24GBのRTX 3090を4枚使用してLaguna S 2.1 INT4をデプロイし、精度を揃えたDFlashドラフトモデルによって190K-tokenの実リクエストを処理している。282.5 token/sは特定の設定におけるピーク値であり、持続スループットではない。低ビット量子化の品質と互換性も、依然としてcheckpointと実行エンジンに大きく左右される。