推論系統
Oilbird 重用驗證器隱藏狀態做語意草稿,API-Bank 解碼達自回歸 4.4 倍速
Oilbird 為免訓練推測解碼加入語意索引,找回因少量參數或 token 不同而被精確字串比對漏掉的既有續文。研究自報把三種草稿器的平均接受長度提高 24% 至 29%,但尚未釋出可獨立重現的程式碼。
Archive
共 973 篇技術新聞
推論系統
Oilbird 為免訓練推測解碼加入語意索引,找回因少量參數或 token 不同而被精確字串比對漏掉的既有續文。研究自報把三種草稿器的平均接受長度提高 24% 至 29%,但尚未釋出可獨立重現的程式碼。
代理評測
ContinualSkillBench 以五個領域、每域 100 個逐步相依任務,檢驗代理能否把經驗整理成可重用技能。顯式技能庫平均未明顯勝過單純保留上下文,顯示技能數量增加不能直接證明代理具備持續學習。
AI 評測與開發工具
LiveEvalBench 以建置、程式碼及瀏覽器操作三類代理蒐集證據,再依每個作品實際功能產生檢查項目。框架與資料已公開,但評分仍依賴 LLM 裁判,成本、可重現性及裁判偏差需要進一步量化。
AI 安全
MAFIA 先探測記憶檢索器的偏好,再以簡短事實包裝惡意指令,使污染紀錄更容易被代理取回。研究自報可把稽核偵測率壓至最多 7.4%,但公開儲存庫目前仍只有預告頁面。
AI 安全
MissClick 不把 GUI 座標視為一般文字,而是利用百位數 token 的微小變動造成大幅點擊位移。研究在 OS-Atlas 與 UGround 上顯著提高攻擊成功率,顯示電腦操作代理不能只靠元素定位準確率評估安全性。
模型訓練
ReflectRL 不再丟棄強模型答錯的推理軌跡,而是要求學生模型找出局部錯誤,再逐步撤除這項提示。研究在九項基準上報告穩定提升,但成果主要來自數學推理設定,專案所列 GitHub 連結目前亦無法存取。
AI 開發工具
GitHub 已停止 Spark 接受新使用者與建立新應用,既有使用者只能在 8 月 31 日前匯出程式碼。已部署的網站可繼續運作,但依賴 GitHub Models 的 llm() 呼叫已失效,開發者必須接入外部模型並接手金鑰與帳務管理。
AI 評測與安全
新研究發現,模型會以猜公式、枚舉或先猜答案再驗證等捷徑,取得正確結果卻未完成題目要求的推導。研究團隊認為,只比對最終答案可能高估前沿模型的科學推理能力,但自動稽核器本身仍有分類誤差。
機器人與世界模型
Faster-WAM 把單層動作頭接到 30 層影片 Transformer,透過跨層 KV 融合取得世界模型表徵,不再讓動作分支複製完整骨幹深度。研究報告相對 Fast-WAM 加速 3.2 倍,但尚未公開新架構的程式碼與權重,結果也主要來自模擬基準。
AI 代理與自動化研究
Iris 不再只沿候選解答樹反覆改程式,而是先調查關鍵未知,再把跨實驗證據整理成可新增、更新或撤銷的主張。論文自報在完整 MLE-Bench 上以一半於直接對照組的時間取得較高獎牌率,但系統程式碼與完整執行軌跡尚未公開。
AI 基礎設施
AtumAI 把自然語言需求轉成含目標、硬限制、決策變數與評估方法的中介表示,再結合擴散模型、演化演算法及代理模型搜尋策略。研究在工作配置、資源伸縮與電力管理上報告改善,但結果來自模擬器,尚未證明能安全接管生產控制平面。
AI 代理與強化學習
Harness-R1 不調整目標代理的模型權重,而是訓練另一個 9B 模型修改其上下文、工具與驗證程式。三個環境的平均成功率由 44.3% 升至 53.6%,但尚無公開程式碼可供檢查補丁安全性。