代理評測
言語をまたぐプロンプト変更でエージェントのツール経路が変化、4つの大規模モデルで行動方針の保持率は71~73%にとどまる
Microsoftの研究チームが41言語、238万回のrolloutを比較したところ、同一タスクでも言語を変えると、貪欲復号を用いた場合でさえエージェントは異なるツール経路を選ぶことが分かった。非英語タスクは英語への事前翻訳に大きく依存しているが、今回のツールは記号化された呼び出しにすぎず、実際のAPIで発生するエラーや副作用はまだ考慮されていない。
Archive
技術ニュース 975 件
代理評測
Microsoftの研究チームが41言語、238万回のrolloutを比較したところ、同一タスクでも言語を変えると、貪欲復号を用いた場合でさえエージェントは異なるツール経路を選ぶことが分かった。非英語タスクは英語への事前翻訳に大きく依存しているが、今回のツールは記号化された呼び出しにすぎず、実際のAPIで発生するエラーや副作用はまだ考慮されていない。
模型量化與推論
ReRoundはキャリブレーション用コーパスを使用せず、モデル自身の重みから条件付き拡散モデルを学習し、量子化区間の中点付近にある重みを切り上げるか切り下げるかを再判定する。デプロイ時は既存の低ビット形式を維持し、追加の推論オーバーヘッドも発生しないが、モデルごとに数時間の専用再構成コストが事前に必要となる。
AI 代理與自動化研究
研究者らは、GPT‑5‑miniと2時間の予算を固定した条件下で、デバッグアドバイザーに探索ブランチ間で実行環境の制約を共有させ、AIDEの90回の実行すべてで有効な提出を生成させた。この結果は、エージェントの外側の仕組みには依然として回収可能な計算資源が大量に残されていることを示すが、実験対象は9件の表形式予測コンペティションに限られる。
AI 程式開發/軟體測試
研究者らは、ローカルモデルにPythonのリファクタリング前後のdiffのみを読み取らせ、Ropeによる217件の変換から、挙動を変化させる欠陥13種類を特定した。メンテナーはうち12件を欠陥として受理したが、モデルの適合率は0.67にとどまり、テストや静的解析を代替できる水準には達していない。
自動駕駛/多模態模型
XPengはXCoT-VLAを提案し、数十個の自然言語推論トークンを有限の意味的アクショントークンに置き換え、flow matchingによって連続軌跡を生成する。オープンループ試験では横方向誤差が低減したものの、クローズドループでの安全性評価はまだなく、レイテンシの数値にも車載ソフトウェア/ハードウェアスタック全体は含まれていない。
AI safety evaluation
REDAgentBenchは、ワークスペース、メール、ブラウザ、銀行、外部ファイルの各サンドボックスで1,661件の攻撃ケースを実行し、被害の発生をエージェントの回答だけで判定する手法を改めた。同一の実行結果をサービスのレシートと最終状態で再評価すると、6モデルすべてで攻撃成功率が軌跡のみの評価より7.73~11.72ポイント高くなった。
AI coding tools
1,867件の公開リポジトリを対象とした研究で、CLAUDE.mdなどのエージェント指示ファイルにはルールが追加され続ける一方、古いルールは次第に削除されにくくなることが判明した。対照実験では、各ルールを追加した理由をモデルが読める形で残すことで、余分な指示の99.3%を除去できたが、大規模な実環境のコードベースではまだ前向きに検証されていない。
AI 軟體與企業管理
内部テスト中だったOneDriveの写真エクスペリエンスが誤って広範囲に有効化され、一部の管理対象Windows 11 PCにも入口が表示された。当初は同期アプリを残したまま個別に削除できなかった。Microsoftは管理者向けのサインインポリシーと個別アンインストール機能をMicrosoft 365 Roadmapに追加したが、いずれの修正もまだ提供予定の段階にある。
多模態評測
第8回LSVOSのMeViSv2-Audio優勝報告では、音声文字起こし、視覚的ローカライゼーション、セグメンテーション、対象の存在判定を多段階のパイプラインに分割し、候補マスク間の一致度に基づいて軌跡を選択する。システムの最終スコアは0.769589だったが、公式公開リーダーボードは依然として発表待ちと表示されており、コードや完全なアブレーションデータも公開されていない。
代理框架與自我改進
Open-Ended Optimizationは、目標、データ境界、インタラクション権限、評価を固定する一方、エージェントがどのように証拠を収集し、スキルを修正するかは事前に規定しない。GPT‑5.5をオプティマイザーとして用いた場合、多くの設定でSkillOptやGEPA系のプロセスを上回ったが、中程度およびより弱いモデルでは同様の優位性を維持できなかった。
AI 安全與評測
事前登録された再現性監査により、実行可能でクラッシュを引き起こす脆弱性PoCであっても、指定されたCVEを実際に再現しているとは限らないことが判明した。調査対象30件のうち20件では修正版でも同じシグナルが発生しており、AIエージェント向けセキュリティベンチマークには、文字列や終了コードより厳格な判定器が必要であることが示された。
強化學習/評測
DSLEはDocker、Wine、仮想ディスプレイ、プロセスメモリの読み取りを活用し、市販ゲームのリアルタイム戦闘を並列リセット可能な強化学習ベンチマークへと変換する。5種類のベースラインのうち、安定して攻略できたのはチュートリアルのボスだけで、論文で公開済みとされているコードも現時点ではリポジトリに存在しない。