代理評測
ContextWeave 以千項可執行辦公任務重測代理記憶,偏好分數由 41.50 升至 70.60
ContextWeave 不再只問代理能否找回舊資訊,而是檢查記憶能否改善後續文件與辦公工作。實驗顯示保留可採取行動的完整經驗優於短摘要,但錯誤回憶也更容易影響執行結果。
Archive
共 972 篇技術新聞
代理評測
ContextWeave 不再只問代理能否找回舊資訊,而是檢查記憶能否改善後續文件與辦公工作。實驗顯示保留可採取行動的完整經驗優於短摘要,但錯誤回憶也更容易影響執行結果。
AI 評測
MatrAIx 將相關人口屬性組合成 83 億筆模擬使用者,並讓 persona 代理操作問卷、聊天機器人、網站與應用程式。團隊開放約百萬筆核心資料與評測程式,但目前驗證只能證明代理遵循指定角色,不能證明其可取代真人測試。
AI 基礎設施
Microsoft Azure 研究顯示,代理在模型推論、工具與協調器之間反覆切換,使 CPU 重新進入關鍵路徑,GPU 卻經常閒置。原型系統 Agora 可依工作流型態回收算力,但錯誤壓縮平行代理的 GPU 配置反而會讓尾延遲惡化 16 倍。
模型訓練與程式碼 AI
OctoLong 不再把單一程式庫直接串接成長文本,而是沿 AST、語言伺服器及套件相依關係遞迴收集實作。研究團隊釋出 600M 至 14B 模型,實驗顯示依賴密集資料同時改善程式碼檢索、狀態追蹤與 API 使用。
代理訓練與深度搜尋
ABSeeker 將搜尋代理的最終成敗拆成逐步獎勵,保留失敗軌跡中的有效查詢並壓低成功軌跡中的錯誤步驟。團隊已公開 4B 權重、推論及訓練管線,但最佳成績仍倚賴額外的上下文管理與 LLM 裁判。
AI 評測與代理系統
新研究以錯配、歸零及隨機 KV cache 重新稽核多代理潛在通訊,發現移除快取造成的大幅退步,不一定證明接收者使用了發送者的特定資訊。部分自然評測中,歸零使準確率下降 14.7 點,換成其他題目的快取卻只差 0.4 點。
AI 安全與不確定性
新研究在 11 款開放權重模型上檢驗「模型自報信心」能否決定何時轉交人工。Platt 校準雖可把 ECE 降至最低 0.02,嚴格的有限樣本驗證仍在 10% 風險上限下拒絕所有自主作答設定。
世界模型與強化學習
WorldCycle 把動作及其反向操作組成封閉迴圈,無須真實未來影片即可量測長期狀態漂移。研究在 8B 影片世界模型上降低最多 44% 的循環誤差,複合動作準確率由 0.136 升至 0.553。
AI 安全與評測
新研究以成對提示比較模型受到明示指令與隱性暗示影響時,思維鏈是否會留下可偵測證據。七款推理模型在部分隱性設定仍改變答案,監控器的偵測率卻比明示設定低最多 46 個百分點。
模型評測
新研究以語音轉錄與 QWERTY 鍵盤擾動測試指令模型,發現語音造成的結構改寫會一致降低作答表現。提高推理預算幾乎可修復鍵盤通道,卻無法同樣挽救口語輸入。
代理評測
GDPevo 將企業流程拆成原子規則,再於保留測試題重新組合,以判斷代理能否從先前任務累積可轉移策略。公開結果顯示自主演化確有增益,但距離取得完整規則的 91.6% 上限仍遠。
新基準以可視辨識的真實實體測試視覺語言模型,發現只用文字做知識遺忘,效果不易轉移至圖片與跨模態問答。多模態遺忘可回頭通過文字測試,顯示單一文字評測可能高估刪除成效。