AI safety evaluation
REDAgentBench 以服務最終狀態重算代理攻擊率,文字軌跡漏判最高 11.72 個百分點
REDAgentBench 在工作區、郵件、瀏覽器、銀行與外部檔案沙箱執行 1,661 個攻擊案例,不再只憑代理回答判斷是否造成傷害。同一批執行改用服務收據與最終狀態評分後,六款模型的攻擊成功率均較純軌跡評分高 7.73 至 11.72 個百分點。
Archive
共 970 篇技術新聞
AI safety evaluation
REDAgentBench 在工作區、郵件、瀏覽器、銀行與外部檔案沙箱執行 1,661 個攻擊案例,不再只憑代理回答判斷是否造成傷害。同一批執行改用服務收據與最終狀態評分後,六款模型的攻擊成功率均較純軌跡評分高 7.73 至 11.72 個百分點。
AI coding tools
一項涵蓋 1,867 個公開儲存庫的研究發現,CLAUDE.md 等代理指令檔會持續加入規則,舊規則卻愈來愈少被刪除。受控實驗顯示,替規則保留可供模型讀取的加入理由,可移除 99.3% 的多餘指令,但結果尚未在大型真實程式庫中前瞻驗證。
AI 軟體與企業管理
OneDrive 內部測試中的相片體驗被意外廣泛啟用,部分受管理的 Windows 11 電腦也出現入口,且最初無法在保留同步程式的情況下單獨移除。微軟現把管理員登入政策與獨立解除安裝列入 Microsoft 365 Roadmap,但兩項修正仍在排程中。
多模態評測
第八屆 LSVOS 的 MeViSv2-Audio 冠軍報告把語音轉寫、視覺定位、分割與目標存在判定拆成多階段流程,再以候選遮罩間的一致性選出軌跡。系統最終分數為 0.769589,但官方公開排行榜仍標示待公布,程式與完整消融資料亦未釋出。
代理框架與自我改進
Open-Ended Optimization 固定目標、資料邊界、互動權限與評測,但不預先規定代理應如何蒐證及修改技能。GPT‑5.5 擔任優化器時多數設定勝過 SkillOpt 與 GEPA 類流程,但中等與較弱模型無法維持同樣優勢。
AI 安全與評測
一項預先註冊的重現性稽核發現,能執行並觸發崩潰的漏洞 PoC,不一定真的重現指定 CVE。受查的 30 個案例中有 20 個在修補版本仍觸發相同訊號,顯示代理安全基準需要比字串與退出碼更嚴格的判定器。
強化學習/評測
DSLE 以 Docker、Wine、虛擬顯示器與程序記憶體讀取,把商業遊戲中的即時戰鬥改造成可平行重設的強化學習基準。五種基線只穩定攻克教學頭目,而論文所稱已公開的程式目前尚未出現在儲存庫。
應用研究/AI 基礎設施
GENCO 透過異質圖注意力、物理量解碼及反覆殘差修正,統一處理潮流、最佳潮流與狀態估計。大型電網的批次推論明顯快於傳統 AC 求解器,但零樣本跨電網及真實 SCADA 準確率仍不足以直接取代既有工具。
AI 編程工具
Coderlet 將模型呼叫、工具驗證、執行結果與持久記憶拆成三個明確邊界,並以 MIT 授權提供可執行的 Python 實作。它適合研究代理控制流與失敗復原,不是性能更強的編程代理,而且目前會直接沿用使用者的作業系統權限。
模型可解釋性
Universal Activation Bus 將五個語言模型的中間表徵對齊至固定的 3,072 維空間,新模型只需訓練自己的線性編碼器與解碼器。實驗中的模型可沿用同一組探針、稀疏自動編碼器及自然語言解釋器,但較寬模型的表徵重建仍會明顯失真。
醫療 AI
Google 將低延遲對話、深度臨床規劃與影音感知拆成三個非同步代理,在 100 個模擬視訊問診情境的整體評分高於醫師組的 68%。研究仍只使用專業病人演員,模型、程式及影音資料亦未公開,不能直接外推至真實醫療部署。
GUI 代理
北京大學研究者讓多模態模型只負責解讀操作意圖,再由 Text/Icon 候選偵測器與凍結 CLIP 選出點擊區域,ScreenSpot-Pro 準確率由所列最佳基線的 18.9%升至 41.3%。論文所稱「無回歸」只適用於最終匹配階段,候選框偵測器本身仍使用框回歸損失,而且尚未公開實作。