全ニュース

技術ニュース 977 件

時間序列與檢索增強

TS-RAG、参照トークンで履歴系列を融合し、6つの予測データセットで平均MSEを0.310に低減

Baiduの研究者らは、RAGをテキスト生成から多変量時系列予測へ応用した。TCNで類似セグメントを検索し、クロスアテンションで融合する。チャネル間依存関係を組み込んだバージョンは、6つのデータセットで掲載されたベースラインを上回った。一方、コードはまだ公開されておらず、使用された従来型ベンチマークについても、保守担当者が識別力を失っている可能性を警告している。

多模態評測

動画モデル、高頻度・多イベント領域で正答率わずか0.2%――サンプリングフレームを増やしてもイベントの根拠は復元できず

拡張版Low Frequency Trapは、プログラム可能な2,190本の動画を用いて、イベント数と頻度を分離して測定した。Gemini 3.6 Flashのボール衝突回数の計数精度はサンプリングの増加に伴って向上したが、タイムスタンプ系列のF1は逆にわずか3.7%だった。

多模態評測

視覚モデルは画像を拡大しても証拠を採用するとは限らない、Qwen3‑VL‑8Bの純増益はわずか6.9ポイント

新たな研究は、反実仮想クロップを用いて6つのオープンモデルを検証し、「ツールを呼び出すこと」と「ツールの返却内容が実際に回答を変えること」を区別した。正の増益の大半は、適切に較正された少数の軌跡に集中しており、最終精度だけを見ると視覚ツールの能力を過大評価する恐れがある。

模型訓練

DASH、推論の分岐に応じて蒸留重みを動的配分、Qwen3-1.7Bの数学平均スコアが3.2ポイント向上

DASHは、各tokenにおける教師と生徒の差異を一律に扱うのではなく、推論全体にわたる分岐の変化に応じて監督範囲を調整する。3種類のQwen3モデル規模すべてで同一条件のOPSDを上回ったが、最良のcheckpointはテストベンチマークの平均スコアで選定されており、汎化性能の向上を過大評価している可能性がある。

AI 輔助晶片設計

MicroEvo、LLMとMCTSでプロセッサ設計を探索、目標達成に必要なシミュレーション回数をNSGA-II比で10.6分の1に

MicroEvoは、プロセッサ設計の知識、Pareto木探索、過去のPPAフィードバックを組み合わせ、より少ないシミュレーションで性能・消費電力・面積のトレードオフを探索する。最大36.2%のhypervolume向上はシミュレーション上の設計空間で得られたものであり、実チップの改善と同一視することはできない。

推論系統

PaDoc、レイアウト分岐による文書の並列解析で単一A800のスループットを最大118%向上

PaDocは、レイアウト系列と各領域のコンテンツでページ接頭辞を共有し、並列デコードを行うことで、ページ全体を単一の系列として処理することを回避する。2.1BモデルはOmniDocBenchで総合スコア94.24を維持したが、性能値は単一GPUと特定のスケジューリング設定に基づく。

3D 生成與具身 AI

iARCS、LLMに3Dシーン生成用の報酬プログラムを生成させ、物体衝突率を52.67%から40.45%へ低減

iARCSはまず屋内シーン生成器の衝突と歩行可能性を改善し、その後、自然言語による要件を実行可能な報酬関数へコンパイルして、第2段階の強化学習を行う。3D-FRONTでの実験では、幾何学的指標においてMiDiffusionを上回ったが、新しい要件ごとにLoRAを個別に訓練する必要があり、著者らはまだ実装を公開していない。

邊緣 AI

esp32-ai、2,890万パラメータのモデルをESP32-S3に搭載し、オフライン生成で9.88 token/sを達成

オープンソースプロジェクトのesp32-aiは、4-bit量子化と階層型メモリ配置を採用し、約2,500万の埋め込みパラメータをflashに保持して、tokenごとに必要な行だけを読み出す。10米ドル未満のマイクロコントローラ上でオフラインのテキスト生成が可能だが、その能力は依然として短い物語や単一分野の質問応答に限られる。

推論系統

PhyAI、VLAと世界・行動モデルの推論を統合、公式実装経路との比較で1.40~4.65倍高速化

PhyAIはモデルアダプターにより各アーキテクチャの条件、ソルバー、行動セマンティクスを維持しつつ、グラフ実行、カーネル、キャッシュ、マルチGPUサービスを共通化する。公開テストはπ0、π0.5、GR00T N1.7、Cosmos3、MiniCPM-Robotを対象とするが、一部の比較では数値精度が完全には統一されていない。

AI 評測與教育應用

TutorMoments、実際の指導判断を再現し、7つのLLMにデフォルトで過剰なヒントを与える傾向があることを確認

Ai2は、実際の数学個別指導のトランスクリプト462件を基に再現可能な評価を構築し、モデルに「足場かけを提供する」か「生徒に深い推論を求める」かを選択させた。両者のトレードオフを明示すると7つのモデルすべてで性能が向上したが、生徒のシミュレーションとモデルによる採点だけでは、実際の学習効果を証明できない。