全ニュース

技術ニュース 972 件

推論系統

llama.cpp b10472、AMD APUのメモリ判定を修正し、Strix Haloに存在しない空き容量が割り当てられる問題を回避

新版では、Linux HIPビルドにおいてシステムの`MemAvailable`でGPUメモリ情報を上書きする処理を廃止し、`hipMemGetInfo`の値を信頼するよう変更した。この修正は、UMA carveoutを調整可能なAMD APUを対象としており、モデルローダーが容量を過大評価し、後から失敗するリスクを軽減する。

代理評測

PACE-Bench、物理法則の変更で既存のエージェント設計が機能不全に――完全設定で最高のPass@2も35.9%にとどまる

PACE-Benchは、144件の実行可能な物理環境を用い、摩擦や材料の制約が変わったことで動作しなくなった、過去には成功していたプログラム設計をエージェントが修正できるかを検証する。実験では、未検証の自己修正よりReflexionが優れる一方、長期記憶はむしろ高性能なモデルを初期案に縛り付けることが示された。

訓練基礎設施

Rollplex、VLM強化学習のプレフィックス計算をrolloutの空き時間に組み込み、32基のH800で最大1.30倍の学習高速化

Rollplexは、参照モデルと学習用actorの動画エンコードおよびprompt prefillを自己回帰デコード中に先行実行しながら、同期on-policyのセマンティクスを維持する。CUDA VMMでフェーズをまたぐメモリを管理し、テンソル並列度が異なる学習プロセスと推論プロセス間で互換性のある重みを共有する。

模型訓練與最佳化

sMuon、MuonをLoRAで表現可能な部分空間に射影し、ReLoRAでRiemannionと同等の損失を達成しつつ約30%高速化

sMuonは、完全な重み行列に対する直交化方向を、LoRA因子で表現可能な低ランク空間へ射影したうえで、純粋な行列乗算によって更新を計算する。ReLoRA実験ではRiemannionと同じ最低検証損失を達成した一方、複数モデルのファインチューニング結果は、基盤モデルの事前学習に用いられたオプティマイザに大きく依存した。

AI 代理/機器學習工程

ScienceFlow、実行可能なワークスペースをエージェントの記憶に統合し、75問のMLE-benchでAny-Medal率70.22%を達成

ScienceFlowは会話の要約を保存するだけでなく、コード、検証エビデンス、リソース記録、ワークスペースのスナップショットを、復元可能なStageとしてパッケージ化する。公式報告では、MLE-bench全75問でAny-Medal率70.22%を達成したが、システム間の比較は依然としてモデル、ハードウェア、時間予算の違いに左右される。

推論系統

llama.cpp b10456、SYCLの量子化変換スケジューリングを修正——Arc 70のQ4_0→FP32スループットが158.19 GB/sに向上

新版では量子化ブロックのサイズに応じてスレッド数とワークグループ数を設定し、SYCL copy kernelの過剰または不十分なサブスクリプションを回避。Arc 70のマイクロベンチマークではスループットが20.21 GB/sから158.19 GB/sに向上したが、これはモデル全体のtoken生成速度が同じ比率で向上することを意味しない。

模型架構/推論

Intern-S2-Mobius、FFNの記憶をモデル全体で共有し、35Bモデルで約4倍のエンドツーエンド推論高速化を報告

Intern-S2-Mobiusは、従来のTransformerで各層に結び付いていた知識ストレージと注意機構による推論を分離し、複数のReasonerが同一のグローバルMemoryを繰り返し参照できるようにする。オープンウェイトはLMDeploy、vLLM、Transformersで読み込めるが、約4倍という高速化は、あくまで公式の特定ベンチマークにおける結果だ。

生成式影像工具

コミュニティが単一フレームVAEでMiniMax H3を画像編集モデルに転用、ComfyUIの最低5フレーム制約が互換性のギャップに

コミュニティが動画モデルMiniMax H3向けに5.21GBの単一フレームVAEを学習し、reference-to-videoパイプラインで1フレームのみを生成して、衣装変更、ポーズ変更、視点変換を実行できるようにした。この手法は、動画モデルを画像編集モデルとして再利用できる可能性を示す一方、現時点では非公式の重み、特定のワークフロー、まだ完全には実装されていないComfyUIの単一フレームインターフェースに依存している。

開放模型

Qwen3.8-27B、線形/フルアテンションのハイブリッド構成でネイティブ262Kコンテキストを実現し、マルチステップMTPも維持

QwenはQwen3.8-27Bの重みを公開した。64層のGated DeltaNet/Gated Attentionハイブリッド構成によって長大なコンテキストのコストを抑えつつ、ネイティブな視覚理解と調整可能な推論深度を提供する。公式のエージェント評価では大幅な向上が示されているが、一部のデータセット、修正版の問題、実行フレームワークはQwen自身が設定しているため、ベンダー横断の公平なランキングと直接見なすことはできない。

推論系統

FreeBalance、MoEの人気エキスパートを事前予測し、8基のA800でprefillレイテンシを最大13.1%削減

FreeBalanceは前層の残差状態から次層のエキスパート負荷を予測し、重みの交換とattention計算をオーバーラップさせる。最終的なルーティングやモデル出力は変更しないが、現時点での検証範囲は2つのMoEモデル、単一の8 GPUトポロジー、prefillワークロードに限られる。