全ニュース

技術ニュース 972 件

AI 基礎設施

Cerebras CS-4、3基のWSE-3Tでラックシステムを構成し、ピーク帯域幅を129.6 PB/sに拡大

CS-4は新しいプロセスへ移行したものではなく、WSE-3のクロック周波数、電力供給、I/Oを強化し、3基のウェハスケールプロセッサーでNexusラックを構成する。推論速度はGPUベースのソリューションと比べて最大30倍と公式にうたうが、PFLOPSやワット当たりスループットについては、比較可能な独立したエンドツーエンドテストが依然として不足している。

AI 代理評測

ComponentBench、2,910件のWeb操作を要素単位で分析 同一エージェントでもインターフェース方式により34ポイント超の差

ComponentBenchは、完全なワークフローでエラーを覆い隠すのではなく、スライダー、日付ピッカー、データテーブル、ドラッグ&ドロップなどのUIコンポーネントを個別にテストする。同一のタスクとフレームワークにおいて、GPT-5 miniの成功率はaccessibility tree使用時が83.1%、座標指定によるピクセル操作のみの場合が48.9%だった。

推論系統

MoEルーターでキャッシュミスを60%削減するも、パープレキシティ劣化1%の基準を満たせず

事前登録研究で、専門家の局所性をMoEルーターに直接学習させる試みが行われたが、キャッシュ性能の改善とモデル品質の間に明確なトレードオフがあることが判明した。学習済みルーティングと学習不要の再ルーティングを組み合わせることで、ミス率をさらに低減できるものの、それが同程度のエンドツーエンド高速化につながることはまだ実証されていない。

代理訓練

SkillGate、スキル選択と実行のフィードバックを分離し、9Bエージェントの成功率を40.8%から53.2%へ向上

SkillGateは、長いワークフローを実行するエージェントを結果報酬で訓練すると、スキル選択に使われる少数のtokenには有効な信用割当がほとんど届かないことを明らかにした。新手法は、同一のGRPO更新内で2つの勾配経路を分離し、5つのエージェント評価で結果報酬ベースラインを上回った。

評測與可靠性

LLM審判者がまず判定し、その後に検索または棄権――較正済みしきい値で誤判定率を制御

新たなフレームワークは予測エントロピーに基づき、LLM審判者が判定をそのまま採用するか、Web上の証拠を検索するか、棄権するかを決定し、Clopper–Pearson上限を用いて2つのしきい値を較正する。オープンドメイン質問応答の32通りの実験設定すべてで指定された誤り率を維持したが、この保証は同一分布の較正データと信頼できるラベルに依存する。

AI 晶片/邊緣視覺

ETHEREAL、時空間イベントキャッシュでVGAイベントビジョンを処理、イベント当たりの推論実測値は25.6マイクロ秒

28nm ETHEREALチップは、不規則なイベントグラフアクセスと規則的なspline convolutionを分離して処理し、レイヤーごとの4/8ビット精度にも対応する。DAGr-GNNの実測値はイベント当たり25.6マイクロ秒、1.6マイクロジュールだが、検出ヘッドの最後の3層は依然としてチップ外で評価されている。

資訊檢索/RAG

DEPT、文書ベクトルを固定したままクエリ拡張をエンドツーエンドで学習、Qwen3-4BのBEIR平均スコアが42.59に上昇

DEPTは、同一のデコーダーでクエリ拡張の生成と文書のエンコードを同時に行い、保存損失によって既存のベクトルインデックスがファインチューニングに伴ってドリフトするのを防ぐ。5つのBEIR評価で段階的なベースラインを上回ったが、結果は依然として1回の実験と2つの小型モデルに基づく。

生成模型與推論最佳化

OYS、拡散モデルのノイズ除去タイムステップを直接探索し、5ステップで50ステップ時の品質の89〜94%を維持

OYSはモデルの変更や蒸留を行わず、ベイズ最適化によってモデルとタスクごとに少ステップのノイズ除去スケジュールを探索する。研究では6種類のtext-to-imageモデルと画像修復タスクで改善が報告されたが、探索コストを多数の事前生成サンプルによって償却する必要がある。

AI 代理與瀏覽器自動化

Wuying Browser Agent、エラー回復データで長期的な操作フローを訓練——27BモデルがBrowserBenchで65.1%を達成

Alibaba Cloudチームは、ブラウザエージェントのエラー回復、複雑なUI操作、長期的な信用割当を単一の訓練パイプラインに統合した。27Bモデルは、新たに構築された中国語・英語バイリンガルのBrowserBenchでPass@1 65.1%を達成したが、モデルの重みと評価データが一般公開されているかどうかは、依然として確認が必要だ。

AI 評測與推理

IOL-AI、未公開の言語学オリンピック問題で推論能力を評価:14Bモデルがデコード手順によりベースラインスコアを2倍超に向上

IOL-AI Challengeでは、少数の例から未知の言語の規則を導き出し、翻訳、転写、訂正を行うことがシステムに求められる。T4 GPU 1基という制約下で、最高提出は同一モデルのベースラインGMを9.40から19.79へ引き上げたが、金メダル水準に達したクローズドモデルとの差は依然として大きい。