全ニュース

技術ニュース 970 件

代理安全

PolicyGuide、永続的なフロー図でカスタマーサポートエージェントを制約し、4回連続合格率を0.42から0.62に向上

PolicyGuideは、ツール呼び出しの直前にポリシー違反のアクションを阻止するだけでなく、各ユーザーターンで未完了のポリシーステップを追跡する。3つのτ²-benchドメインで信頼性の高い成功率を向上させた一方、ターンごとに1回のLLM検証が追加され、手続き遵守の指標の一部は著者らが独自に設計している。

推論系統

Pandora Router、モデル評価コストをルーティングに組み込み、EmbedLLMの総合損失を0.386に低減

Google DeepMindは、高コストなモデル評価を実行するかどうかを「Pandora’s box」探索問題として定式化し、情報価値に基づいて追加評価の要否を逐次判断する。3種類のテストすべてで、平均ルーティング後悔と評価コストの合計が最小となったが、その効果は適切にキャリブレーションされたシグナル分布とコスト設定に依存する。

AI 開發工具

Mojoがコンパイラとツールチェーンのソースコードを公開、単一のBazelコマンドでソースからビルド可能に

ModularはMojo 1.0のリリースから1週間後、KGENコンパイラ、ツール、標準ライブラリをApache 2.0 with LLVM Exceptionsで公開した。ソースコードは閲覧および独自ビルドが可能になったが、コンパイラへの外部コントリビューションは現時点で受け付けておらず、MAXも引き続き別ライセンスで提供される。

AI 晶片與邊緣推論

Waymo、5nm車載ASICを公開:フロントエンドのセンサー演算性能は1,000 TOPS超

Waymoがロボタクシーのヘテロジニアス・コンピューティング・アーキテクチャを初めて明らかにした。自社開発ASICがカメラ、LiDAR、レーダーのデータをリアルタイムで処理し、コア推論エンジンへ渡す。1,000 TOPSについては数値精度と消費電力が示されておらず、NVIDIAやTeslaの車載プラットフォームとは直接比較できない。

代理記憶與評測

エージェント記憶はサブタスク単位に分割すると転移の信頼性が向上、テキストスキルがコードを平均2.9ポイント上回る

9モデルと3種類の長期プロセス評価を対象とした研究で、タスク全体から抽出したスキルは概してエージェントの性能を低下させる一方、サブタスクから抽出すると平均的に性能が向上することが示された。自然言語による手順メモも、実行可能なPythonスキルより安定していたが、効果は依然としてモデルと評価に大きく左右される。

代理記憶與評測

MemTrapBench:関連する記憶を追加すると、5つのエージェント記憶戦略のスコアが逆に少なくとも10.66ポイント低下

MemTrapBenchが評価するのは、記憶を取り出せるかどうかではない。正しく関連性のある過去の経験が、モデルを誤った戦略や信念に縛り付けるかを検証する。5つの記憶手法はいずれも、2つのモデルで記憶なしのベースラインを下回り、単純なプロンプトベースのガードレールで回復できたのも損失の一部にとどまった。

代理強化學習

SAPO、単一の自己回帰モデルにactorとcriticを兼任させ、エージェントRLの1イテレーション当たりの学習を33.2%高速化

SAPOは生成シーケンス内の2つの因果的境界を利用して状態価値と行動価値を同時に読み出し、独立したcriticや同一プロンプトに対する複数回のrolloutを不要にする。Qwen2.5-7BはALFWorldとWebShopの総合指標でPPO、GRPOを上回ったが、現時点では公開実装による検証が不足している。

機器人與世界模型

DECOWAM、ロボット犬のベースとアームの表現を分離し、2,595万パラメータの更新だけで動作MSEを21.7%低減

DECOWAMは、凍結した60.2億パラメータのFastWAMに、ベース、アーム、カメラの自己運動インターフェースを追加し、デプロイ時には現在の観測のみを使って48ステップの動作を予測する。実機ロボット試験での全体完了率はFastWAMをわずかに上回る程度だったが、ベースへの外乱に対するロバスト成功率は12.7%から30.4%に向上した。

AI 推論與開發工具

Axon、強い型付けのDSLから5種類のLLMバックエンドを生成、MLXの中央値レイテンシをTransformersの48.3%に低減

Axonは、モデルアーキテクチャをシンボリックなテンソル形状を持つ関数型仕様として記述し、PyTorch、Triton、JAX、MLX、ネイティブvLLM向けにコンパイルする。467件の推論テストでは多くの生成モデルが高速化した一方、一部のBF16モデル、エンコーダーモデル、シーケンス・ツー・シーケンスモデルでは、精度または性能の低下も確認された。

多代理與可組合泛化

モジュールの可視情報を制限することで再利用可能な潜在通信を促進、10組のペア実験のうち9組で少なくとも20ポイント上回る

Qwen2.5-0.5Bと同一のLoRAを共有する4つのモジュールが、注意マスクの違いだけでまったく異なる合成戦略を学習した。各モジュールが自身の証拠断片しか見られないよう制限すると、サンプル間で転用可能な中間値通信が形成されやすくなったが、事前登録された全体成功基準には0.0012届かなかった。