代理評測與可靠性
TRACE 從成功與失敗軌跡改寫代理 Skills,隱藏測試一致通過率升至 70%
小米團隊提出 TRACE,以成功/失敗軌跡的對比結果迭代可檢索 Skill Bank,不修改底層模型權重。它在 CAR-bench 隱藏集提高三次皆成功的比例,但平均 token、成本及延遲亦同步增加。
Archive
共 955 篇技術新聞
代理評測與可靠性
小米團隊提出 TRACE,以成功/失敗軌跡的對比結果迭代可檢索 Skill Bank,不修改底層模型權重。它在 CAR-bench 隱藏集提高三次皆成功的比例,但平均 token、成本及延遲亦同步增加。
AI 開發工具
Gradio 正式介紹內建的 `gr.Workflow`,同一份節點圖可供視覺化除錯、部署至 Spaces,並自動產生 REST 端點。互動畫布能平行執行同層節點,但經生成的 API 呼叫時目前仍會依序執行,效能測試不能直接沿用畫布結果。
代理開發平台
Dify 1.17.0 新增 E2B 執行後端、建置期 home snapshot、版本化 Skills 與分層上下文壓縮,讓代理每次啟動可取得一致的工具和檔案狀態。這不是無痛小版本更新:資料庫遷移、Compose 配置及多個環境變數都已改動,自架用戶須重新核對部署。
AI 代理與開源工具
Laude Institute 與 MIT 公開不足一萬行 Bash 的 Headlong,把訊息視為持續思考軌跡中的非同步觀察,而非新工作階段。這種設計可研究長期記憶與自發行動,但也把 token 成本、權限隔離及跨使用者資料邊界變成常駐風險。
應用研究/科學資料工程
新管線把 NASA GCN Circulars 的測光、紅移與觀測時間轉成事件層級結構化資料,並已投入即時運作。內部稽核錄得 99.80% 欄位判定正確率,但時間與觀測設施歸屬仍是主要錯誤來源,研究用途須回查原文。
影片生成/推論系統
H3 Super Acceleration 先以低解析度、四步去噪建立草稿,再交由 LTX 與 Sol-Attn 用三步完成高解析度細化。官方測得 768p、10 秒影片較 SGLang 基準快 27.7 倍,但加速改變了取樣路徑,並非等品質的純核心最佳化。
代理開發工具
Microsoft 新增可供 Claude Code、Codex 與 GitHub Copilot 使用的 Agent Lightning Skill,讓程式代理在固定 benchmark 上修改另一個可編輯代理。它是一套受預算約束的實驗規則,不會自動替目標代理進行強化學習。
推論系統
Ray Serve LLM 現在把提示詞 token 化、快取命中估算與副本選擇集中在 ingress,並把 token 直接傳給推論引擎。設計可減少重複 prefill 與 token 化,但官方未公布新版效能數據,控制平面亦帶來額外同步成本。
RAG 與推論工程
新架構在檢索與主模型之間加入一次低成本模型呼叫,只保留與問題相關的原文片段及來源識別碼。AWS 的內部測試錄得約三成成本下降,但評分依賴單一企業語料與 LLM judge。
AI 安全與評測
研究團隊用八個開放模型家族產生約 20 萬筆受壓情境資料,再以 LoRA 訓練模型判斷自己是否說謊。偵測器主要學到諂媚、能力否認等表面模式,面對未見類型時僅略勝提示式基線。
世界模型與生成影片
ReWorld 把短期動作控制與長期場景記憶分配給不同注意力範圍,再以固定容量的地標庫保存歷史。作者展示 704×1280 即時串流及 64 秒返回軌跡,但目前只有論文和示範頁,尚未發布權重或程式碼。
AI 代理與開源工具
Prime Agent 以常駐 IPython、daemon 工作階段及可版本化的 Continual Harness 支援長時間程式代理。作者報告 ARC-AGI-3 RHAE Best@1 從 30% 升至 95.5%,但成績反映整套模型與 harness,不能當作底層模型能力的單獨比較。