RAG 與文件工程
READはエージェントによる構造化長文書の直接検索を可能にし、51問で正解率58.8%を達成。ただしBM25を有意には上回らず
READは、固定チャンク分割とベクトルTop-Kの代わりに、語彙検索、構造ナビゲーション、セクション読み取りを採用し、証拠取得の各工程を再現可能にする。780ページの財務報告書では密検索を大幅に上回ったが、標本が小さくコストも高いため、エージェント検索が従来の語彙インデックスより優れていると主張できるだけの証拠はない。
Archive
技術ニュース 979 件
RAG 與文件工程
READは、固定チャンク分割とベクトルTop-Kの代わりに、語彙検索、構造ナビゲーション、セクション読み取りを採用し、証拠取得の各工程を再現可能にする。780ページの財務報告書では密検索を大幅に上回ったが、標本が小さくコストも高いため、エージェント検索が従来の語彙インデックスより優れていると主張できるだけの証拠はない。
電腦視覺
CogVisは、時系列間の画像比較とテキストによるクラス判定を分離し、複数のオープンボキャブラリクエリで同一のシーン変化特徴を再利用できるようにした。著者らは7つのベンチマークで最高性能と28.5%のスループット向上を報告しているが、モデルの重みはコードとともに公開されていない。
代理訓練
AgentOPSDは、教師と学生の確率差をターンごとの信念更新として累積し、タスクの成否を真に左右した意思決定を特定する。著者らは、3種類のエージェント環境でGRPOおよび複数の自己蒸留ベースラインを上回ったと報告しているが、公開リポジトリには現時点で訓練コードが含まれていない。
GUI 代理/世界模型
AppDeltaWorldは次のスクリーンショットを直接生成するのではなく、まずアクションによって到達可能なレイアウトを検索し、HTML差分を生成して合成画像を組み込む。クローズドループの訓練軌跡を構築できる一方、現時点での成果は独自評価と未公開の完全実装に依存している。
具身 AI/評測
GAUGEは物理エンジンと生成世界モデルを同一の実測ベンチマークで評価し、軌跡、方程式の形式、物理パラメータの観点から誤差を個別に診断した。その結果、映像がもっともらしく、方程式の形式に適合していても、加速度、運動量伝達、振動周期が正しいとは限らないことが示された。
AI 評測與後訓練
MISTは、モデルが誤ったプロンプトに抵抗できるかだけでなく、正しい外部情報を引き続き取り入れられるかも検証する。関連手法のSCOPEは、Qwen3-4Bの正答から誤答への転換率を35.0%から16.3%に低減したが、現時点で訓練による検証が完了しているのは、2つの小規模なオープンモデルファミリーに限られる。
AI 代理與開發工具
新たな研究では、API schemaを型付きPython stubにコンパイルし、モデルが1回の推論でツール呼び出しを連結または並列実行できるようにした。この手法はBFCL v4のサブセットにおいて、大半のモデルでネイティブJSONと同等以上の性能を示した。ただし、現時点で検証されたのは引数をそのまま返す模擬ツールのみであり、実際のAPI workflowでも同様の効果が得られるとはまだ証明されていない。
機器人/世界模型
GeniWorldはまずURDFを用いて関節動作をピクセル単位で整合したロボット運動へ変換し、その後、因果DiTによって環境の応答を予測する。著者らは4つの実機タスクにおいて、全体の成功率が40.8%から69.0%へ向上したと報告しているが、コードとモデルの重みはまだ公開されていない。
多模態模型評測
新たな研究は、最終的なカウントだけでなく、実行可能な時間軌跡を用いて動画モデルを監査した。Gemini 3.6 Flashはイベント数と頻度がともに高い領域で正答率がわずか0.2%にとどまり、実際のイベントの18.1%しか検出できなかった。
代理工程與評測
HarnessOpt-Benchは、固定された評価予算内でモデルにプロンプト、ツール、メモリ、制御フローを変更させ、非公開テストセットで実際の改善幅を測定する。111件の実験では、モデル自体による差が外側のcoding harnessによる差を上回った一方、ネイティブツールが一貫して優位とは限らなかった。
代理系統/可觀測性
TrajDebugは、エージェントの軌跡で最初に発生したエラーをそのまま根本原因とは見なさず、エラーが修復されたか、最終結果に影響を残したか、復旧予算を消費したかを追跡する。チームが人手でアノテーションした486件の軌跡で検証したところ、診断結果をプロンプトに変換することで、同一タスクの再実行成功率が平均10.8%向上した。
模型最佳化
研究は、Adamと低ランク復元の差異を、座標ごとの前処理器が gauge equivariance(ゲージ同変性)を持たないことに帰着させた。公開実験では、機能的に等価な2つの初期化をAdamで学習した結果、注意機構の不変量に56%の差が生じたが、この結論は大規模モデルの事前学習ではまだ検証されていない。