模型架構與推論
Matryoshka、3種類のモデルを単一の重みに内包し、学習計算量を36%削減
Matryoshka Language Model Suitesは、500M、1.5B、3Bのサブモデルを個別に切り出せる入れ子構造として連結し、サイズごとの重複学習を回避する。前段の層とKVキャッシュを共有することで、投機的デコーディングのスループットも14%から26%向上するが、現時点で検証されているのは3B級の基盤モデルに限られる。
Archive
技術ニュース 977 件
模型架構與推論
Matryoshka Language Model Suitesは、500M、1.5B、3Bのサブモデルを個別に切り出せる入れ子構造として連結し、サイズごとの重複学習を回避する。前段の層とKVキャッシュを共有することで、投機的デコーディングのスループットも14%から26%向上するが、現時点で検証されているのは3B級の基盤モデルに限られる。
AI 程式驗證
P³は、エージェントがコードを書く前に、実装構造、補助補題、証明の分解方法を共同で計画し、実装後に証明を繰り返し修正する事態を防ぐ。3つのLean 4ベンチマークにおける全モデル構成で比較対象のワークフローを上回ったが、最難関のリポジトリタスクでは、最高でも22.2%しか解決できなかった。
AI 硬體設計
ArchAgent v2はL1D、L2、LLCの各プリフェッチャを段階的に進化させ、リアルタイムの容量チェックによってハードウェア予算を超える候補を排除する。最終設計はDPC4シミュレーション環境で人間設計の王者BertiGOを0.3%上回ったが、実チップではまだ検証されていない。
檢索與推論系統
Tevatron-Elasticは、early exit、Matryoshkaベクトル、層間token圧縮を設定可能なoperating pointとして統合し、1つのcheckpointで複数のコスト構成に対応する。Qwen3‑0.6B rerankerは第16層で完全な品質を維持しつつ、著者らのテスト環境で1.75倍の高速化を達成した。
AI 編程與評測
SWE-Bench ProMaxは、29,782件の候補コミットから複数ファイルにまたがる170件のリファクタリングタスクを選定し、専門家が要件を書き直してテストを検証した。GPT‑5.2とOpenHandsの組み合わせが最高の解決率を記録したものの、実行軌跡からは、エージェントが周辺の呼び出し箇所や設定、テストファイルの変更を見落としがちであることが分かった。
推論系統與評測
KVDiagnosisは長文コンテキストの総合スコアを比較するだけでなく、各圧縮設定についてFullCacheとのペアを作成し、エビデンスの保持、アテンション、確率のドリフトを追跡する。チームは実装監査により、結果が完全に一致していたPyramidKVの7,800組の記録も除外し、手法横断の評価がアダプターの不具合によって容易に汚染され得ることを浮き彫りにした。
AI 安全與代理框架
SHEはエージェントの安全ハーネスをシステムプロンプト、ルールベース、安全メモリ、ツールポリシーに分解し、失敗軌跡に基づいて局所的に改訂する。Agent-SafetyBenchでは攻撃成功率と誤拒否率を同時に低減したが、実環境への導入では評価器のバイアスやルールの自己肥大化を防ぐ必要がある。
AI 安全與內容來源
Anthropicによると、8月2日以降に提供されるClaudeモデルは、テキストに不可視のマーカーを埋め込み、対応する画像や文書には署名付きの来歴データを付与する。技術仕様と第三者向け検出ツールはまだ公開されておらず、現時点でこのマーカーを生成元の完全な証明とみなすことはできない。
模型安全研究
新たな研究によると、自己回帰モデルを基に改造された拡散型LLMは、少数のニューロンに集中した安全機構も引き継いでいる可能性がある。研究者らはオープンな拡散モデルを使って攻撃プロンプトをオフライン生成したが、公開を約束している完全なコードはまだリリースされていない。
開發者平台
OpenAIは8月10日にAPIの`gpt-5.2-chat-latest`を終了し、公式にはGPT‑5.5への移行を推奨している。今回廃止されるのはChatGPTの挙動に追随するエイリアスであり、エンジニアリングチームはプロンプト、ツール呼び出し、出力形式を改めて検証する必要がある。移行を同等なルーティングの切り替えと見なすことはできない。
推論系統
コミュニティが再現可能なvLLMレシピを公開した。24GBのRTX 3090を4枚使用してLaguna S 2.1 INT4をデプロイし、精度を揃えたDFlashドラフトモデルによって190K-tokenの実リクエストを処理している。282.5 token/sは特定の設定におけるピーク値であり、持続スループットではない。低ビット量子化の品質と互換性も、依然としてcheckpointと実行エンジンに大きく左右される。
PTQ4SNN 把脈衝神經網路長期保留的浮點膜電位納入後訓練量化,按通道配置 2、4 或 8 位元。論文在分類與語意分割上接近浮點模型,但硬體收益仍來自分析模型,且專用程式尚未公開。