推論系統
FreeToken、CPU・GPU・PCIeを動的に割り当て、35B MoEを8GBのVRAMで実行
FreeTokenは固定的なオフロードを採用せず、実測帯域幅に基づいて、キャッシュミスしたエキスパートをGPUへ転送するか、CPUで直接計算するかを決定する。論文では単一のワークステーションGPUによる753Bモデルのサービングも実演しているが、全重みには依然としてメインメモリが必要であり、「753Bモデル全体が1枚のGPUに収まる」という意味ではない。
Archive
技術ニュース 970 件
推論系統
FreeTokenは固定的なオフロードを採用せず、実測帯域幅に基づいて、キャッシュミスしたエキスパートをGPUへ転送するか、CPUで直接計算するかを決定する。論文では単一のワークステーションGPUによる753Bモデルのサービングも実演しているが、全重みには依然としてメインメモリが必要であり、「753Bモデル全体が1枚のGPUに収まる」という意味ではない。
AI 安全與開發工具
EnterpriseユーザーはMythos 5でコードベースをスキャンし、CWE分類、重大度、信頼度評価、推奨修正を取得できるようになった。モデル自体は引き続き管理されたサービスの背後に置かれ、修正には人によるレビューが必要だが、Anthropicは検出精度をまだ公表していない。
代理系統與評測
AVOは永続メモリ、監督エージェント、テキストグリッドインターフェースを活用し、Claude Opus 5で全公開レベルを6,624回の環境アクション以内に完了した。ただし、100点というスコアは公開セットのみを対象としており、セミプライベートまたはプライベートの競技テストに合格したことを意味しない。
AI 編程工具與安全
新版では、一部のClaude Codeウェブツールのリクエストをセッションネットワークプロキシ経由にすることを義務付け、プロキシ環境、MCPの再接続、機密入力の処理に関する問題も修正した。Python SDKの移行コマンドも追加されたが、Anthropicは脆弱性の深刻度や影響範囲を公表していない。
生成式視覺與 4D 重建
固定長の参照コンテキストと、拡散プロセス中の視点再編成により、多視点動画を分割生成する際の構造的ドリフトを抑える。重みと推論パイプラインは公開されたが、4D Gaussian Splattingによる再構成の完全なオープンソース化と低メモリモードはまだ実現していない。
代理協定
MCPメンテナンスチームは、次段階の仕様策定を、サーバー主導イベント、エージェントアイデンティティ、段階的なツール探索など5つの領域に集約した。これらはまだロードマップ上の項目であり、既存SDKによるTasksと拡張通知のサポートにも不足がある。
模型訓練基礎設施
Marinは、総パラメータ数535B、各tokenで約23Bを有効化するMoEモデルのトレーニングを開始した。11基のGB200 NVL72を使用し、約18T~18.75T tokenを処理する計画だ。設定、スケーリング実験、リアルタイムテレメトリは公開されているが、モデル品質、長コンテキスト対応策、最終的なtoken予算はまだ確定していない。
音訊模型
Imperial College Londonのチームは、因果Transformer、stop-gradient、コサイン損失により、音声の自己教師あり事前学習を簡素化した。この手法は6つの分類ベンチマークで安定したスケーリングを示したが、ASR、生成タスク、AudioSet以外のコーパスへの汎化はまだ実証されていない。
模型訓練
北京智源研究院の研究チームが、RAGを使わずに固定文書群に関する質問へ回答できるようにする3段階のポストトレーニング手法を提案した。8つの実験条件のうち7つで通常のSFTを全面的に上回ったが、成果は依然として合成質問応答、モデルジャッジ、モデルごとのハイパーパラメータ調整に依存している。
多模態模型與 API
DeepSeekはV4-Flashに画像理解機能を追加し、互換性のある3種類のインターフェースを通じてテキストと画像を処理できるようにした。料金体系は従来のFlashモデルと同じだが、公式発表のエージェント評価スコアは独立した再現検証がなく、モデルウェイトやビジョンアーキテクチャも公開されていない。
代理框架與上下文基礎設施
新バージョンでは、エージェントのSkillsを一元的に保存、検索、キャッシュする仕組みをVikingBotに統合したほか、ユーザー単位のメモリ取得ポリシーと永続化可能なバックグラウンドインポートを追加した。同時に、実験的なRelations APIとCLIコマンドが削除されたため、既存の統合環境ではアップグレード前の移行が必要となる。
AI 推論基礎設施
新バージョンでは起動時にcheckpoint stagingとCUDA Graph captureを並行処理し、公式のH100テストで通常のデフォルトフローに比べ2.38倍高速化した。テンソル並列通信の一部も刷新し、7つのモデルファミリーを追加した一方、Torchのアップグレードとキャッシュパスの統合に伴う移行コストが発生する。