代理強化學習
SAPO 讓單一自回歸模型兼任 actor 與 critic,代理 RL 每輪訓練快 33.2%
SAPO 利用生成序列的兩個因果邊界,同時讀出狀態值與動作值,毋須獨立 critic 或同題多次 rollout。Qwen2.5-7B 在 ALFWorld 與 WebShop 的整體指標皆勝過 PPO、GRPO,但目前仍缺少公開實作驗證。
Archive
共 962 篇技術新聞
代理強化學習
SAPO 利用生成序列的兩個因果邊界,同時讀出狀態值與動作值,毋須獨立 critic 或同題多次 rollout。Qwen2.5-7B 在 ALFWorld 與 WebShop 的整體指標皆勝過 PPO、GRPO,但目前仍缺少公開實作驗證。
機器人與世界模型
DECOWAM 在凍結的 60.2 億參數 FastWAM 上加入底座、手臂及相機自我運動介面,部署時只使用當前觀測預測 48 步動作。實體機器人測試的整體完成率僅略高於 FastWAM,但底座受擾穩健率由 12.7% 提高至 30.4%。
AI 推論與開發工具
Axon 將模型架構寫成具符號張量形狀的函數式規格,再編譯至 PyTorch、Triton、JAX、MLX 與原生 vLLM。467 組推論測試顯示多數生成模型加速,但部分 BF16、編碼器及序列到序列模型仍出現精度或效能退化。
多代理與可組合泛化
四個共享 Qwen2.5-0.5B 與同一 LoRA 的模組,只因注意力遮罩不同,便學出截然不同的組合策略。限制每個模組只能看到自己的證據片段,較容易形成可跨樣本移植的中間值通訊,但預先註冊的整體成功門檻仍以 0.0012 之差落敗。
模型訓練與代理
MidTool-Mix 從網頁、PDF、程式碼與真實工具介面合成 203 億 token,讓模型在 SFT、RL 之前先學習工具邊界、參數與工作流程。配合相同 SFT 配方時,Qwen3-4B 的 BFCLv3 總分由 39.73% 升至 50.25%,但深度搜尋任務仍完全未解。
AI 評測與安全
新研究發現,單次貪婪解碼與不穩定門檻可讓完全未訓練的模型看似獲得或失去能力。改用逐題精確檢定後,三種自我訓練只穩定強化既有能力,未能證明取得基礎模型從未觸及的新能力。
代理系統
PILOT 將實驗管理、分群策略搜尋與記憶整理交給三個 LLM 角色,但把權限、統計判定及狀態寫入留給確定性服務。淘寶五個線上 bucket 的內部結果顯示搜尋效率提高 40 個百分點,但報告未提供可公開重現的程式與流量規模。
AI 評測
CentaurBench 以七類工作任務分開評估模型的自動化與輔助能力,兩種排名的相關係數僅約 0.48。無輔助的 GPT-3.5-Turbo 在三項任務勝過所有受指導版本,顯示加入強模型不必然改善代理流程。
Agent frameworks
TrueFoundry 以 MIT 授權釋出 TrueForge,將代理迴圈、MCP 工具、按需沙盒、子代理及核准流程組成可自行託管的執行框架。官方在 Enterprise-Bench 報告相同模型可節省約 30%,改用 GLM-5.2 則節省約 75%,但比較僅涵蓋 14 項任務。
AI coding tools
Salesforce 推出 Slack Code,讓團隊從對話直接建立專案專屬 Code Channel,並共同監看、修正及核准代理產生的程式碼。首波串接 Claude、Devin、GitHub Copilot、ChatGPT 與 Vercel 代理,但安全隔離、權限粒度及 API 細節仍未完整公開。
代理評測/可觀測性
AFANet 把代理對話轉成含時間及同代理連線的圖,再以兩層 GCN 判斷故障代理與錯誤類型。它在 AEGIS-Bench 勝過多款 LLM 基線,但跨資料集的代理—錯誤配對 F1 仍偏低。
RAG/深度研究代理
DeepWeaver 以 Thought Block Chain 整理主張、關鍵資訊與來源,再反覆檢查尚未利用的證據。它改善多款模型的長篇回答與引用指標,但新評測集中於中文水環境問題,程式碼也尚未真正釋出。