代理安全
PolicyGuide、永続的なフロー図でカスタマーサポートエージェントを制約し、4回連続合格率を0.42から0.62に向上
PolicyGuideは、ツール呼び出しの直前にポリシー違反のアクションを阻止するだけでなく、各ユーザーターンで未完了のポリシーステップを追跡する。3つのτ²-benchドメインで信頼性の高い成功率を向上させた一方、ターンごとに1回のLLM検証が追加され、手続き遵守の指標の一部は著者らが独自に設計している。
Archive
技術ニュース 970 件
代理安全
PolicyGuideは、ツール呼び出しの直前にポリシー違反のアクションを阻止するだけでなく、各ユーザーターンで未完了のポリシーステップを追跡する。3つのτ²-benchドメインで信頼性の高い成功率を向上させた一方、ターンごとに1回のLLM検証が追加され、手続き遵守の指標の一部は著者らが独自に設計している。
推論系統
Google DeepMindは、高コストなモデル評価を実行するかどうかを「Pandora’s box」探索問題として定式化し、情報価値に基づいて追加評価の要否を逐次判断する。3種類のテストすべてで、平均ルーティング後悔と評価コストの合計が最小となったが、その効果は適切にキャリブレーションされたシグナル分布とコスト設定に依存する。
AI 開發工具
ModularはMojo 1.0のリリースから1週間後、KGENコンパイラ、ツール、標準ライブラリをApache 2.0 with LLVM Exceptionsで公開した。ソースコードは閲覧および独自ビルドが可能になったが、コンパイラへの外部コントリビューションは現時点で受け付けておらず、MAXも引き続き別ライセンスで提供される。
AI 晶片與邊緣推論
Waymoがロボタクシーのヘテロジニアス・コンピューティング・アーキテクチャを初めて明らかにした。自社開発ASICがカメラ、LiDAR、レーダーのデータをリアルタイムで処理し、コア推論エンジンへ渡す。1,000 TOPSについては数値精度と消費電力が示されておらず、NVIDIAやTeslaの車載プラットフォームとは直接比較できない。
模型訓練與推論效率
新たな研究では、NoThink、Short、Longをモデルが生成する最初のtokenとし、別途ルーターを設けることなく、問題ごとに推論予算を割り当てる。MATH-500ではベースモデルに近い精度を維持しつつ、より簡単なGSM8Kではtokenを76%削減した。
代理記憶與評測
9モデルと3種類の長期プロセス評価を対象とした研究で、タスク全体から抽出したスキルは概してエージェントの性能を低下させる一方、サブタスクから抽出すると平均的に性能が向上することが示された。自然言語による手順メモも、実行可能なPythonスキルより安定していたが、効果は依然としてモデルと評価に大きく左右される。
模型產品
8 月 21 日前後,DeepSeek Pro 灰測消息在開發者社群延燒;目前可確認的是官方 8 月 21 日公告只發布 Flash Vision 實驗模型,Pro 仍未公布新版本號。社群觀察到的「I’m doing」思維鏈與 B 站實測,更像一次小範圍路由或後端模型灰度放量。
代理記憶與評測
MemTrapBenchが評価するのは、記憶を取り出せるかどうかではない。正しく関連性のある過去の経験が、モデルを誤った戦略や信念に縛り付けるかを検証する。5つの記憶手法はいずれも、2つのモデルで記憶なしのベースラインを下回り、単純なプロンプトベースのガードレールで回復できたのも損失の一部にとどまった。
代理強化學習
SAPOは生成シーケンス内の2つの因果的境界を利用して状態価値と行動価値を同時に読み出し、独立したcriticや同一プロンプトに対する複数回のrolloutを不要にする。Qwen2.5-7BはALFWorldとWebShopの総合指標でPPO、GRPOを上回ったが、現時点では公開実装による検証が不足している。
機器人與世界模型
DECOWAMは、凍結した60.2億パラメータのFastWAMに、ベース、アーム、カメラの自己運動インターフェースを追加し、デプロイ時には現在の観測のみを使って48ステップの動作を予測する。実機ロボット試験での全体完了率はFastWAMをわずかに上回る程度だったが、ベースへの外乱に対するロバスト成功率は12.7%から30.4%に向上した。
AI 推論與開發工具
Axonは、モデルアーキテクチャをシンボリックなテンソル形状を持つ関数型仕様として記述し、PyTorch、Triton、JAX、MLX、ネイティブvLLM向けにコンパイルする。467件の推論テストでは多くの生成モデルが高速化した一方、一部のBF16モデル、エンコーダーモデル、シーケンス・ツー・シーケンスモデルでは、精度または性能の低下も確認された。
多代理與可組合泛化
Qwen2.5-0.5Bと同一のLoRAを共有する4つのモジュールが、注意マスクの違いだけでまったく異なる合成戦略を学習した。各モジュールが自身の証拠断片しか見られないよう制限すると、サンプル間で転用可能な中間値通信が形成されやすくなったが、事前登録された全体成功基準には0.0012届かなかった。