推論系統
llama.cpp b10472、AMD APUのメモリ判定を修正し、Strix Haloに存在しない空き容量が割り当てられる問題を回避
新版では、Linux HIPビルドにおいてシステムの`MemAvailable`でGPUメモリ情報を上書きする処理を廃止し、`hipMemGetInfo`の値を信頼するよう変更した。この修正は、UMA carveoutを調整可能なAMD APUを対象としており、モデルローダーが容量を過大評価し、後から失敗するリスクを軽減する。
Archive
技術ニュース 972 件
推論系統
新版では、Linux HIPビルドにおいてシステムの`MemAvailable`でGPUメモリ情報を上書きする処理を廃止し、`hipMemGetInfo`の値を信頼するよう変更した。この修正は、UMA carveoutを調整可能なAMD APUを対象としており、モデルローダーが容量を過大評価し、後から失敗するリスクを軽減する。
代理評測
PACE-Benchは、144件の実行可能な物理環境を用い、摩擦や材料の制約が変わったことで動作しなくなった、過去には成功していたプログラム設計をエージェントが修正できるかを検証する。実験では、未検証の自己修正よりReflexionが優れる一方、長期記憶はむしろ高性能なモデルを初期案に縛り付けることが示された。
訓練基礎設施
Rollplexは、参照モデルと学習用actorの動画エンコードおよびprompt prefillを自己回帰デコード中に先行実行しながら、同期on-policyのセマンティクスを維持する。CUDA VMMでフェーズをまたぐメモリを管理し、テンソル並列度が異なる学習プロセスと推論プロセス間で互換性のある重みを共有する。
CForce 沿用擴散語言模型自己的生成軌跡,把後期較完整的預測蒸餾回早期遮罩狀態。LLaDA2.1-mini 在提高平行解碼量的同時維持準確度,但證據目前集中於同一模型家族與作者控制的評測。
模型訓練與最佳化
sMuonは、完全な重み行列に対する直交化方向を、LoRA因子で表現可能な低ランク空間へ射影したうえで、純粋な行列乗算によって更新を計算する。ReLoRA実験ではRiemannionと同じ最低検証損失を達成した一方、複数モデルのファインチューニング結果は、基盤モデルの事前学習に用いられたオプティマイザに大きく依存した。
AI 代理/機器學習工程
ScienceFlowは会話の要約を保存するだけでなく、コード、検証エビデンス、リソース記録、ワークスペースのスナップショットを、復元可能なStageとしてパッケージ化する。公式報告では、MLE-bench全75問でAny-Medal率70.22%を達成したが、システム間の比較は依然としてモデル、ハードウェア、時間予算の違いに左右される。
推論系統
新版では量子化ブロックのサイズに応じてスレッド数とワークグループ数を設定し、SYCL copy kernelの過剰または不十分なサブスクリプションを回避。Arc 70のマイクロベンチマークではスループットが20.21 GB/sから158.19 GB/sに向上したが、これはモデル全体のtoken生成速度が同じ比率で向上することを意味しない。
模型架構/推論
Intern-S2-Mobiusは、従来のTransformerで各層に結び付いていた知識ストレージと注意機構による推論を分離し、複数のReasonerが同一のグローバルMemoryを繰り返し参照できるようにする。オープンウェイトはLMDeploy、vLLM、Transformersで読み込めるが、約4倍という高速化は、あくまで公式の特定ベンチマークにおける結果だ。
生成式影像工具
コミュニティが動画モデルMiniMax H3向けに5.21GBの単一フレームVAEを学習し、reference-to-videoパイプラインで1フレームのみを生成して、衣装変更、ポーズ変更、視点変換を実行できるようにした。この手法は、動画モデルを画像編集モデルとして再利用できる可能性を示す一方、現時点では非公式の重み、特定のワークフロー、まだ完全には実装されていないComfyUIの単一フレームインターフェースに依存している。
開放模型
QwenはQwen3.8-27Bの重みを公開した。64層のGated DeltaNet/Gated Attentionハイブリッド構成によって長大なコンテキストのコストを抑えつつ、ネイティブな視覚理解と調整可能な推論深度を提供する。公式のエージェント評価では大幅な向上が示されているが、一部のデータセット、修正版の問題、実行フレームワークはQwen自身が設定しているため、ベンダー横断の公平なランキングと直接見なすことはできない。
AI 評測與開發工具
英国のAI Security Instituteが、問題およびタスク単位の事後不確実性に基づいて反復評価の停止時点を決めるoptstopをオープンソース化した。9件のシャドーテストでは試行を平均81.1%削減したが、効果はスコア形式、問題の順序、交換可能性の仮定によって異なる。
推論系統
FreeBalanceは前層の残差状態から次層のエキスパート負荷を予測し、重みの交換とattention計算をオーバーラップさせる。最終的なルーティングやモデル出力は変更しないが、現時点での検証範囲は2つのMoEモデル、単一の8 GPUトポロジー、prefillワークロードに限られる。