AI 代理與評測
Echoverse 以可重設的狀態式網站訓練電腦代理,9B 模型評測升至 67.1%
微軟的 Echoverse 不再追求大量淺層網站複製品,而是建立具資料庫狀態、因果後果與可驗證任務的合成應用。以十二個環境訓練後,9B 模型跨十四個測試切分由 36.5% 提升至 67.1%,但公開版本只包含其中四個環境。
Archive
共 975 篇技術新聞
AI 代理與評測
微軟的 Echoverse 不再追求大量淺層網站複製品,而是建立具資料庫狀態、因果後果與可驗證任務的合成應用。以十二個環境訓練後,9B 模型跨十四個測試切分由 36.5% 提升至 67.1%,但公開版本只包含其中四個環境。
AI 標準與代理基礎設施
新版 MCP 將協定版本、能力與客戶端資訊放進每次請求,移除 `initialize` 握手及 `Mcp-Session-Id`。這能簡化水平擴展,卻是需要同步升級客戶端、伺服器與閘道規則的破壞性變更。
多模態評測
Moonshot AI 從 42 個既有基準的最早失敗點建立感知分類,再以 3,000 道短答案題隔離十項基本視覺能力。結果顯示整體分數相近的模型可能具有完全不同的感知缺口,但測試集源自更大的內部題庫,仍需防範污染與評測者偏差。
本地 AI 與代理應用
Home Assistant 新增 llama.cpp 與 LiteLLM 對話整合,可為不同模型建立各自的代理與指令。更新降低本地模型接入門檻,但目前仍是 beta,端到端工具呼叫可靠性取決於模型、schema 與硬體。
多模態模型與推論
微軟的 Mage-VL 不再均勻抽取影片影格,而是利用 I/P frame、運動向量與殘差能量,只編碼變化較大的區域。4B 模型宣稱可減少逾 75% 視覺 token 並維持靜態任務能力,但速度與品質比較仍主要來自官方測試。
代理系統/長期記憶
MemChain 不把向量檢索結果直接塞給語言模型,而是先規劃、排序並壓縮成具來源依據的主動記憶。研究在 LoCoMo 與 LongMemEval-S 報告領先結果,但尚未公開完整程式與實際延遲成本。
機器人與具身 AI
HiFi-UMI 將離線立體慣性 SLAM、微秒級同步與雙手六視角整合成可攜式資料系統,使純人類操作資料能直接用於機器人後訓練。三種 VLA/世界動作模型的實機成功率接近場內遙操作基線,但結果仍集中於單一團隊的受控任務。
實體 AI/科學自動化
PUDA 把自動化儀器公開為可探索的命令列工具,並以 JSON、NATS/JetStream 和穩定識別碼保存命令、量測及樣本來源。代理可以選擇下一場實驗,但實際硬體操作只能經過工程師預先撰寫及參數驗證的驅動方法。
AI 程式開發
CAPA 將使用者反覆省略的實作偏好植入 600 場可執行程式任務,檢驗助理能否從過往對話推斷新需求。十二款模型加入同使用者歷史後,最終成功率僅平均增加 6.8 點,但首次成功率提高 15.6 點,顯示記憶主要減少來回確認,而非消除失敗。
代理評測
TREK 不再以 LLM 評審旅遊計畫,而是逐項驗證實體、預算、營業時間、交通與隱含需求。15 款代理中表現最佳者也只完整通過 46.2% 的可解任務,顯示局部正確仍難組成可執行行程。
AI 安全與代理評測
SecRespond 讓安全代理分析遭入侵主機的唯讀磁碟快照,而非只在乾淨環境解攻擊題。23 款模型雖能重述告警,卻普遍漏掉未被告警揭露的植入物與修復驗證。
代理系統與工具路由
新研究指出,相關性排名只能決定工具順序,無法回答代理應載入多少工具。CAM-DF 直接學習繼續載入的邊際收益,在維持相近任務成功率下減少 37% 工具暴露。