LLM 推論系統
TEMPO、実測実行時間に基づきMoEエキスパートを割り当て、Qwen3‑235Bのp99トークンレイテンシを約15.6%削減
TEMPOは、トークン数やアクティブ化されたエキスパート数を単に均等化するのではなく、HBMからの重みロードとGEMMタイルのパディングを同時に推定する。SGLangのプロトタイプは、一部のQwen3‑235Bトラフィックでスループットを4~6%向上させた一方、通信律速のDeepSeek‑V3では追加コストだけが残った。
Archive
技術ニュース 973 件
LLM 推論系統
TEMPOは、トークン数やアクティブ化されたエキスパート数を単に均等化するのではなく、HBMからの重みロードとGEMMタイルのパディングを同時に推定する。SGLangのプロトタイプは、一部のQwen3‑235Bトラフィックでスループットを4~6%向上させた一方、通信律速のDeepSeek‑V3では追加コストだけが残った。
AI 程式代理與評測
Veroは、エージェントに複数モジュールからなるコードを実装し、単体テストに合格するだけでなく、機械的に検証可能な正当性証明を提出するよう求める。4つの最先端エージェント構成のうち、最良の構成でも16リポジトリを完全には解決できず、うち10件はすべての構成が失敗した。
AI 科研代理
OmniScientistは、エージェントが画像、信号、映像、3D構造、軌跡を直接調べたうえで、着想、実験、論文執筆までを行えるようにする。36件のケースすべてで完全な原稿を生成したが、ケース数の不一致、コードの公開状況、自動評価の設計にはなお確認すべき点が残る。
代理系統
StateBridgeは直交Procrustes変換を用いて、送信エージェントの最終層の隠れ状態を受信エージェントの入力埋め込み空間へマッピングし、プロジェクターの学習を不要にする。4モデルの平均スコアは最強のベースラインを2.4~2.9ポイント上回ったが、現時点では同一のモデル重みを使用するエージェントのみをサポートする。
推論系統/實體 AI
FlashDriveは、視覚エンコーディング、LLM prefill、推論token、軌跡デノイジングという4つのボトルネックを同時に処理し、RTX PRO 6000上でAlpamayo 1.5-10Bの単一ウィンドウ・レイテンシを717ミリ秒から151ミリ秒に短縮した。オープンソース実装はリアルタイム推論に近づいたが、専用のファインチューニングを経ており、クローズドループ評価も100本のシミュレーションクリップに限られる。
世界模型與影片生成
AlayaWorldは、インタラクティブ世界モデルの空間メモリと条件付けパイプラインを刷新し、カメラ制御、過去フレーム、生成コンテンツに整合した因果VAE表現を使用するようにした。新たな報告ではWBenchで一貫性の総合スコア首位を記録したが、新版の重みと推論コードはまだ同時公開されていない。
AI 推論系統
GCacheは、隣接するデノイズステップ間の局所的な類似度で再計算の要否を決めるのではなく、最終的な画質への影響が最小となるキャッシュ再利用シーケンスを探索する。Wan2.1で2.17倍の高速化を維持しながら偏差を大幅に抑えた一方、方策探索には複数のH100が必要で、実装もまだ公開されていない。
推論系統
vTokenはPagedAttentionのブロック層の上に、トークンから物理位置へのマッピングを追加し、退避後に点在するKVの空き領域を再圧縮する。vLLMのプロトタイプでは保持ブロック数を最大72.3%削減したが、評価は依然として単一ノード・単一GPUと、7B~8B級モデルが中心だ。
AI 基礎設施與訓練系統
LazyTrainは学習前にactivationの保持、オフロード、再計算の位置を一括決定し、PCIeおよびNVMe転送をGPUの計算ウィンドウ内に収める。Qwen3.6-27Bの実験では性能が176.90から219.95 TFLOPSに向上したが、現時点で検証されているのは単一GPUとオフラインスケジューリングのみだ。
推論系統
新手法は、数千から1万個の有効な文字列に対してtrieの状態とtoken maskを事前構築し、汎用文法コンパイルにおけるカーディナリティのボトルネックを回避する。著者らの測定では、バッチサイズ256で毎秒219リクエストを処理した。ただし実装はまだ公開されておらず、この数値には既存のguided decoding経路を迂回する統合上の効果も含まれる。
模型訓練與長上下文
新たな研究によると、学習ウィンドウを長くすると、モデルは知識をパラメータに書き込む代わりに文脈へ依存する可能性がある。750M以下の事前学習モデルとQwen3のファインチューニング実験では、補助情報が増える一方、文脈なしや矛盾する状況での堅牢性が低下した。
新研究發現,混合線性注意力模型的巨量啟用並非隨機散布,而會在完整注意力層前形成尖峰,並於中間的線性層維持平台。團隊公開分析程式與受控模型,但完整論文圖表所用的逐筆輸入尚未全部釋出。