電腦操作代理
TMI 從交錯電腦操作重建任務樹,步驟描述準確率由 30.3% 升至 74.9%
Task Model Induction 不把整段螢幕與輸入紀錄壓成單一工作流程,而是先拆出非連續任務,再重建目標階層與迴圈控制流。產生的代理技能在保留題準確率由最佳基線的 14.29% 升至 18.57%,但整套流程依賴前沿模型,且原始操作軌跡帶來明顯私隱風險。
Archive
共 960 篇技術新聞
電腦操作代理
Task Model Induction 不把整段螢幕與輸入紀錄壓成單一工作流程,而是先拆出非連續任務,再重建目標階層與迴圈控制流。產生的代理技能在保留題準確率由最佳基線的 14.29% 升至 18.57%,但整套流程依賴前沿模型,且原始操作軌跡帶來明顯私隱風險。
AI 代理與評測
AI4AI-Bench 把調參與真正改變學習方法分開評估,要求程式代理提交可由零重跑的訓練程式碼。六套系統的 290 次測試中,逾四成表現不及原始演算法,增加推理強度主要只是令代理更願意觸碰核心訓練機制。
AI 基礎設施
DSX MaxLPS 以即時遙測重新分配閒置功率,NVIDIA 測得 GB200 NVL72 機櫃的配置功率可由 125 kW 降至 90 kW而維持吞吐量。方案還結合工作負載功率設定與 45°C 液冷,但核心 Dynamic Power Software 仍處於 Developer Preview。
AI for Science/代理基礎設施
Brain Researcher 以知識圖譜、型別化流程與審查規則約束神經影像分析代理,並保存假設、證據及執行來源。工具路由大幅改善,但可驗證證據落地率仍只有 22.0%,自動審查亦曾漏掉方向性統計錯誤。
具身 AI/安全訓練
SafeBranch 將代理的危險軌跡回滾至關鍵決策點,只比較同一上下文中的安全與不安全動作。訓練後部署毋須外掛 critic,但成果目前限於模擬家居環境,且資料建構仍依賴 GPT-4o 判斷。
AI 安全與模型反學習
ConceptGuard 不再把忘卻集與保留集視為互不相關的事實,而是要求模型抑制同一技術的有害用途並保留正當用途。四種反學習方法均出現遺忘與效用取捨,且不同概念間的效果高度不一致。
AI 評測與形式化推理
FormalTCS 從近兩年頂級理論計算機科學論文抽取研究級問題,逐段測量模型由自然語言主張產生機器可驗證證明的能力。最佳模型在證明既有形式化定理時達 28.6 Pass@8,但將自然語言轉成正確 Lean 定理陳述仍是主要瓶頸。
代理框架與安全
開源代理執行環境 Forge 現可按使用者隔離 MCP 連線與憑證,並自動完成 OAuth 2.1 metadata discovery 及動態用戶端註冊。新版亦補上細粒度出口管制與審批稽核,但目前 MCP 支援仍以 HTTP 傳輸為主。
AI 開發者平台
新版將最低 Python 版本提高至 3.10,並移除 Text Completions、部分取樣參數及用戶端壓縮介面。一般 API 呼叫大多毋須修改,但直接依賴 httpx 的監控、測試與自訂傳輸層必須遷移。
推論系統
Daedalus-150M 專為單使用者、4-bit CPU 推論設計,讓多數網路層不必反覆讀取持續增長的 KV cache。初步結果顯示速度優勢會隨上下文增加,但模型只有 2K 上限,效能數字也仍待跨硬體獨立重現。
AI 安全
新基準將 13 個公開來源的代理技能去重並按結構家族切分,避免近似樣本同時落入訓練與測試集。最佳文字分類器在隨機切分表現亮眼,面對未見來源卻把 62.4% 良性技能誤判為惡意。
代理基礎設施
NVIDIA 更新開源代理執行堆疊,重點處理 vLLM、llama.cpp、Ollama 與模型路由器的狀態漂移。新版也收緊沙盒生命週期、映像來源證明及失敗復原,但仍是快速迭代中的修補版本。