全ニュース

技術ニュース 984 件

語音 AI

AgenticASR、スライディングウィンドウで文字起こしを反復修正—1B Refinerが日中バイリンガル評価を79.95点に押し上げ

AgenticASRは音声認識とテキスト整形を分離し、新しい音声が入力されるたびに小型のRefinerが既存出力の限られた範囲を書き換えることで、文字起こし全体を繰り返し処理する必要をなくす。コード、チェックポイント、917問の日中バイリンガルベンチマークは公開済みだが、音声の大半は音声合成で生成され、採点もLLMジャッジに依存している。

模型訓練與資料

合成教材の章構成自体が継続事前学習を改善、テキストを固定しても平均スコアは1.02ポイント向上

新たな研究では、合計320億tokenに上る68万6,000冊の合成教材を生成し、内容を同一にした対照実験によって文書構造の効果を切り分けた。関連する章を完全な書籍として構成した場合、分割した段落やランダムな連結より優れたが、この成果は研究チーム独自の訓練パイプラインによるもので、データとコードはまだ公開されていない。

AI 推論系統

SemPIC、文書を並べ替え可能なKVキャッシュへ事前コンパイル――長文コンテキストタスクの平均F1は完全な再計算に迫る

SemPICは独立したWriterモデルを用い、入力位置に依存しない文書KVをオフライン生成する一方、Readerでは元のモデルと標準キャッシュインターフェースを維持する。3モデル・4タスクの平均micro-F1は既存手法の0.53から0.60へ向上したが、エンドツーエンドのレイテンシ、キャッシュ容量、コードはまだ公開されていない。

機器人與推論最佳化

QuantWAMs、世界行動モデルを主に4-bitで動作させ、対象モジュールのメモリ使用量をFP16の29%に削減へ

QuantWAMsは、将来の映像とロボットの行動を同時に生成するモデル向けに、量子化キャリブレーションを、構造、結合目的、閉ループ軌跡という3層の意思決定へと再設計した。2つのモデルのシミュレーション成功率はFP16との差が0.2~0.7パーセントポイントだったが、速度データは特定の演算モジュールのみが対象で、実機での比較も各タスク10回にとどまる。

代理系統與評測

ローカルPCエージェントは推論予算を増やしても必ずしも高精度にならず、履歴画像4枚を境に効果が反転

OSWorldを用いた実験により、ローカルGUIエージェントに少量の画面履歴を追加すると反復操作を大幅に減らせる一方、コンテキストやステップ数をさらに増やしても、主に失敗パターンが変化するだけであることが示された。2段階の計画アーキテクチャも、フォーマット処理と連携のコストにより単一エージェントを下回り、計画を並列に多数生成しても、高額なtokenコストをかけて差の一部を埋めるにとどまった。

AI 代理

Qwen-UI-Agent、モバイル・デスクトップ・ブラウザ操作を統合し、長軌跡学習を100ステップ超に拡大

Qwenチームは、モバイル、デスクトップ、Web、DeepSearch環境を横断する統一GUIエージェントを提案し、画面操作とCLIコマンドを同一のアクション空間に統合した。技術報告ではOSWorld-Verifiedで79.5%を達成したとしているが、モデルの重み、訓練データ、完全な軌跡はまだ公開されていない。

評測/強化學習

OSReward、コンピューターエージェントの評価モデルが失敗した軌跡を見逃しがちで、視覚的証拠が判定に与える影響は意外に限定的だと判明

OSRewardは、人手でレビューした1,019件のクロスプラットフォーム軌跡を用いて27種類の視覚言語評価モデルを検証し、主な誤りが未完了のタスクを成功と判定することだと明らかにした。ステップごとのテキストを除くと精度は平均7.2ポイント低下する一方、画面入力の変更による影響は小さく、既存の「視覚評価モデル」がエージェントの自己申告に依存している実態が浮き彫りになった。

代理系統/評測

Tycho、インタラクションを通じてエージェントに世界モデルを記述させ、2つのフロンティアモデルがARC-AGI-3の全公開レベルをクリア

Tychoは未知のゲームルールを実行可能な状態遷移モデルとして記述し、検証結果に基づいてモデルを修正するか、迂回するかを判断する。ある公開セットでのテストでは、GPT-5.6 SolとClaude Opus 5が全183レベルをクリアしたが、結果は依然としてフロンティアAPI、単一回の実行、公開問題に大きく依存している。

AI 代理與評測

Echoverse、リセット可能なステートフルWebサイトでコンピューター操作エージェントを訓練——9Bモデルの評価スコアが67.1%に上昇

MicrosoftのEchoverseは、大量の表層的なWebサイト複製を追求するのではなく、データベース状態、因果的な結果、検証可能なタスクを備えた合成アプリケーションを構築する。12の環境で訓練した結果、9Bモデルは14のテスト分割全体で36.5%から67.1%に向上したが、公開版に含まれるのはそのうち4環境のみだ。

AI 標準與代理基礎設施

MCP 2026-07-28、ハンドシェイクとセッションを廃止し、リモートツールサーバーをステートレスリクエスト方式へ移行

新版MCPでは、プロトコルバージョン、ケイパビリティ、クライアント情報を各リクエストに含め、`initialize`ハンドシェイクと`Mcp-Session-Id`を廃止する。水平スケーリングを簡素化できる一方、クライアント、サーバー、ゲートウェイルールを同時に更新する必要がある破壊的変更だ。

多模態評測

PerceptionBench、視覚推論を10の基本知覚能力に分解――16種のマルチモーダルモデルはいずれも正解率60%未満

Moonshot AIは、42の既存ベンチマークにおける最初の失敗点から知覚能力の分類体系を構築し、3,000問の短答式問題によって10の基本的な視覚能力を切り分けた。その結果、総合スコアが近いモデルでも知覚上の弱点がまったく異なり得ることが示された。一方、テストセットはより大規模な社内問題プールから抽出されており、データ汚染と評価者バイアスには引き続き注意が必要だ。