AI 安全
MaliciousSkillBench 彙整 9,740 個代理技能,跨來源偵測 Macro-F1 跌至 0.665
新基準將 13 個公開來源的代理技能去重並按結構家族切分,避免近似樣本同時落入訓練與測試集。最佳文字分類器在隨機切分表現亮眼,面對未見來源卻把 62.4% 良性技能誤判為惡意。
Archive
共 962 篇技術新聞
AI 安全
新基準將 13 個公開來源的代理技能去重並按結構家族切分,避免近似樣本同時落入訓練與測試集。最佳文字分類器在隨機切分表現亮眼,面對未見來源卻把 62.4% 良性技能誤判為惡意。
代理基礎設施
NVIDIA 更新開源代理執行堆疊,重點處理 vLLM、llama.cpp、Ollama 與模型路由器的狀態漂移。新版也收緊沙盒生命週期、映像來源證明及失敗復原,但仍是快速迭代中的修補版本。
AI 安全與私隱
新研究顯示,即使模型拒絕直接洩密,回覆長度、格式與詞彙等統計特徵仍可能攜帶上下文資訊。自適應黑箱攻擊可近乎完整還原兩位數祕密,四位數精確命中率則達 82%。
AI 程式代理與評測
SWE-bench Science 用 98 個真實科學程式庫測試單位、座標系、數值不變量及檔案格式等隱性契約。Claude Code 搭配 Opus 5 暫居首位,但 pass@1 仍未過半,且工程整合題只有 27.78%。
AI 代理與評測
微軟開源 Thinkingbox,以隔離的 MCP 工具環境及可執行斷言檢查代理是否真正完成工作,而非只看回覆或工具呼叫是否合法。最佳系統單次成功率達 65.36%,但要求同一任務連續成功 20 次時只剩 25.25%。
Task-CoEvolve 依候選 harness 的歷史分歧動態挑選驗證任務,再以抽樣機率估算全體成績。它在 Terminal-Bench 2.1 接近全量搜尋表現,但論文沿用同一批任務搜尋與評分,且程式尚未實際釋出。
推論系統
新方法讓模型在微調時直接適應 H2O 等 KV 淘汰策略,部分 128K 任務的準確率由約 20% 至 64% 提高至逾 90%。但自然問答結果並非全面領先,開源實作也仍定位為研究工具。
推論系統
ReCache 改寫注意力與位置編碼,讓不同請求可重用個別工具或技能的 KV cache。Qwen3 實驗顯示首 token 延遲最多加速 3.655 倍,但方法需要微調模型,尚非可直接套用的推論外掛。
AI 推論系統
騰訊微信與中科院團隊重寫 Hopper 稀疏注意力核心,加入 FP8、分頁 KV cache、連續批次及被裁剪區塊的均值補償。H20 測試的算子加速最高達 47.26 倍,但端到端收益較小,且目前整合依賴專案內附的 SGLang 分支。
AI 可解釋性研究
新方法把推理結果分布視為分段平滑序列,以 PELT 找出真正決策點,再用 Dirichlet 核心池化抑制抽樣雜訊。兩款 8B 模型的實驗顯示可大幅減少重抽樣,但結論目前只涵蓋 tinyMMLU 選擇題。
機器人/VLA 訓練
Google DeepMind 讓視覺語言模型先把長流程機器人任務拆成 VLA 可執行的子目標,再用成功軌跡微調原模型並加入殘差式離策略強化學習。方法提高模擬任務的探索效率,但尚未證明能在實體機器人上取代人工示範。
代理訓練/開源框架
Google Cloud AI Research 等團隊把代理 harness 的概念套到環境端,以可組合介面層改變起始狀態、可見資訊及任務流程。開源實驗涵蓋五套基準,最高提升 9 個百分點,但重現完整結果仍需要多種外部環境與商用模型 API。