代理訓練與基礎設施
ClawGym II 透過代理框架邊界擷取軌跡,讓黑箱 Claude Code 也能參與強化學習
ClawGym II 不改動代理框架內部,而是在模型服務邊界攔截呼叫,再以 prefix tree 還原多輪軌跡。Qwen3-30A3B 經訓練後,在 OpenClaw 與 Claude Code 執行 ClawGym-Bench 的 Pass@1 分別增加 9.98 與 14.81 個百分點。
Archive
共 966 篇技術新聞
代理訓練與基礎設施
ClawGym II 不改動代理框架內部,而是在模型服務邊界攔截呼叫,再以 prefix tree 還原多輪軌跡。Qwen3-30A3B 經訓練後,在 OpenClaw 與 Claude Code 執行 ClawGym-Bench 的 Pass@1 分別增加 9.98 與 14.81 個百分點。
AI 安全與評測
新研究發現,多款 guard model 與 activation probe 刪除、打亂或替換規則後,判斷準確率幾乎不變。專為排除文字捷徑而建的交叉測試中,快速偵測器接近隨機,只有逐步推理模型明顯恢復規則與情境的組合能力。
代理系統研究
史丹福團隊模擬逾一萬個語言模型代理社群,發現多輪通訊會令弱意見逐步形成共識或極化。研究以擴充 Ising 模型預測未見通訊圖上的個體軌跡,但政治題亦出現向右偏移,顯示協作不必然消除模型偏誤。
AI 安全
JailbreakSkill 以統一介面封裝提示改寫、失敗分析及技能演化,讓紅隊代理從未成功的攻擊軌跡產生新程序。第二階段令 AdvBench 與 HarmBench 的跨模型平均攻擊成功率分別再升 17.5 及 13.4 個百分點,但評分依賴 GPT-4o 裁判。
推論系統
ParaTempo 定期探測各條推理路徑的暫定答案分布,據此獨立執行裁切、提前退休及分叉。Qwen3.5-35B-A3B 的四項評測平均準確率較固定 16 路 self-consistency 低 1.1 個百分點,但延遲與生成 token 分別減少 21.8% 及 30.3%。
開發者平台
Anthropic 於 8 月 17 日終止舊版 Workbench 存取,已儲存的 prompts、版本、變數與 evals 無法在新版介面延續。新版改為無伺服器端歷史的 Messages API 試驗台,生成、改進及模板化 prompt 的實驗端點亦一併退役。
推論系統
新版在 Linux HIP 建置中停止以系統 `MemAvailable` 覆寫 GPU 記憶體資訊,改為信任 `hipMemGetInfo`。修正針對可調 UMA carveout 的 AMD APU,可降低模型載入器高估容量後才失敗的風險。
代理評測
PACE-Bench 用 144 組可執行物理環境,測試代理能否修正曾經成功、但在摩擦力或材料限制改變後失效的程式設計。實驗顯示反思優於未驗證自我修訂,而長期記憶反會把較強模型綁在早期方案。
訓練基礎設施
Rollplex 把參考模型與訓練 actor 的影片編碼、prompt prefill,提前至自回歸解碼期間執行,同時維持同步 on-policy 語義。系統以 CUDA VMM 管理跨階段記憶體,並讓不同張量平行度的訓練與推論程序共用相容權重。
CForce 沿用擴散語言模型自己的生成軌跡,把後期較完整的預測蒸餾回早期遮罩狀態。LLaDA2.1-mini 在提高平行解碼量的同時維持準確度,但證據目前集中於同一模型家族與作者控制的評測。
模型訓練與最佳化
sMuon 先把完整權重的正交化方向投影至 LoRA 因子可表達的低秩空間,再以純矩陣乘法計算更新。方法在 ReLoRA 實驗追平 Riemannion 的最低驗證損失,但跨模型微調結果顯著依賴基礎模型原先使用的最佳化器。
AI 代理/機器學習工程
ScienceFlow 不只保存對話摘要,而是把程式、驗證證據、資源紀錄與工作區快照封裝成可恢復階段。官方在完整 MLE-bench 報告 70.22% Any-Medal 率,但跨系統比較仍受模型、硬體與時間預算差異影響。