全ニュース

技術ニュース 973 件

LLM 推論系統

TEMPO、実測実行時間に基づきMoEエキスパートを割り当て、Qwen3‑235Bのp99トークンレイテンシを約15.6%削減

TEMPOは、トークン数やアクティブ化されたエキスパート数を単に均等化するのではなく、HBMからの重みロードとGEMMタイルのパディングを同時に推定する。SGLangのプロトタイプは、一部のQwen3‑235Bトラフィックでスループットを4~6%向上させた一方、通信律速のDeepSeek‑V3では追加コストだけが残った。

AI 程式代理與評測

Vero、コーディングエージェントをLean 4リポジトリ全体へ拡張—最強構成でも完全解決は27/43問

Veroは、エージェントに複数モジュールからなるコードを実装し、単体テストに合格するだけでなく、機械的に検証可能な正当性証明を提出するよう求める。4つの最先端エージェント構成のうち、最良の構成でも16リポジトリを完全には解決できず、うち10件はすべての構成が失敗した。

AI 科研代理

OmniScientist、マルチモーダルな証拠を研究プロセス全体で活用――直接知覚版がペア比較評価の85%で勝利

OmniScientistは、エージェントが画像、信号、映像、3D構造、軌跡を直接調べたうえで、着想、実験、論文執筆までを行えるようにする。36件のケースすべてで完全な原稿を生成したが、ケース数の不一致、コードの公開状況、自動評価の設計にはなお確認すべき点が残る。

代理系統

StateBridge、閉形式アライメントでエージェント間の隠れ状態を伝送――26組のテスト中22組で単独または同率首位

StateBridgeは直交Procrustes変換を用いて、送信エージェントの最終層の隠れ状態を受信エージェントの入力埋め込み空間へマッピングし、プロジェクターの学習を不要にする。4モデルの平均スコアは最強のベースラインを2.4~2.9ポイント上回ったが、現時点では同一のモデル重みを使用するエージェントのみをサポートする。

推論系統/實體 AI

FlashDrive、キャッシュ共有・投機的デコーディング・W4A8により10B自動運転VLAのレイテンシを151ミリ秒に短縮

FlashDriveは、視覚エンコーディング、LLM prefill、推論token、軌跡デノイジングという4つのボトルネックを同時に処理し、RTX PRO 6000上でAlpamayo 1.5-10Bの単一ウィンドウ・レイテンシを717ミリ秒から151ミリ秒に短縮した。オープンソース実装はリアルタイム推論に近づいたが、専用のファインチューニングを経ており、クローズドループ評価も100本のシミュレーションクリップに限られる。

世界模型與影片生成

AlayaWorld v1.1、ストリーミング3Dポイントキャッシュを採用し、長時間動画の一貫性スコアが89.5に向上

AlayaWorldは、インタラクティブ世界モデルの空間メモリと条件付けパイプラインを刷新し、カメラ制御、過去フレーム、生成コンテンツに整合した因果VAE表現を使用するようにした。新たな報告ではWBenchで一貫性の総合スコア首位を記録したが、新版の重みと推論コードはまだ同時公開されていない。

AI 推論系統

GCache、全過程の誤差影響に基づき拡散キャッシュを配置、Wan2.1で同等速度時のLPIPSを0.0316に低減

GCacheは、隣接するデノイズステップ間の局所的な類似度で再計算の要否を決めるのではなく、最終的な画質への影響が最小となるキャッシュ再利用シーケンスを探索する。Wan2.1で2.17倍の高速化を維持しながら偏差を大幅に抑えた一方、方策探索には複数のH100が必要で、実装もまだ公開されていない。

推論系統

vToken、トークン単位の仮想化でKVキャッシュを回収——H100単体でスループットが最大37%向上

vTokenはPagedAttentionのブロック層の上に、トークンから物理位置へのマッピングを追加し、退避後に点在するKVの空き領域を再圧縮する。vLLMのプロトタイプでは保持ブロック数を最大72.3%削減したが、評価は依然として単一ノード・単一GPUと、7B~8B級モデルが中心だ。

AI 基礎設施與訓練系統

LazyTrain、混合整数スケジューリングでメモリ転送をオーバーラップし、H800単体での27Bモデル学習を1.24倍高速化

LazyTrainは学習前にactivationの保持、オフロード、再計算の位置を一括決定し、PCIeおよびNVMe転送をGPUの計算ウィンドウ内に収める。Qwen3.6-27Bの実験では性能が176.90から219.95 TFLOPSに向上したが、現時点で検証されているのは単一GPUとオフラインスケジューリングのみだ。

推論系統

Trie Automataがtoken maskを事前計算、vLLMの有限選択肢デコーディングでXGrammarの29倍のスループット

新手法は、数千から1万個の有効な文字列に対してtrieの状態とtoken maskを事前構築し、汎用文法コンパイルにおけるカーディナリティのボトルネックを回避する。著者らの測定では、バッチサイズ256で毎秒219リクエストを処理した。ただし実装はまだ公開されておらず、この数値には既存のguided decoding経路を迂回する統合上の効果も含まれる。

模型訓練與長上下文

長文脈学習に逆U字曲線:ウィンドウがタスク長の約16~32倍を超えると能力が低下

新たな研究によると、学習ウィンドウを長くすると、モデルは知識をパラメータに書き込む代わりに文脈へ依存する可能性がある。750M以下の事前学習モデルとQwen3のファインチューニング実験では、補助情報が増える一方、文脈なしや矛盾する状況での堅牢性が低下した。