代理記憶
長期記憶摘要只保留 3.05% 時間表達,一句提示令時序問答準確率提高 31.4 點
一項 LoCoMo 實驗發現,通用摘要會保留人物與事件,卻選擇性丟掉日期、時間及持續長度。明確要求逐字保留時間錨點後,時序問題的評審準確率由 15.6%升至 47.0%。
Archive
共 970 篇技術新聞
代理記憶
一項 LoCoMo 實驗發現,通用摘要會保留人物與事件,卻選擇性丟掉日期、時間及持續長度。明確要求逐字保留時間錨點後,時序問題的評審準確率由 15.6%升至 47.0%。
代理評測
CTBench 要求代理查詢真實設備風格的介面,並按專家指定的證據步驟評估根因分析與路徑還原。最佳組合雖把路徑還原正確率推至 87.96%,根因分析仍只有 47.62%,且取得的關鍵證據更少。
AI 數學與形式驗證
OEIS Open 讓通用語言模型在固定成本內證明或否證 492 個整數序列猜想,初始 SafeVerify 評分為 147 題通過。另一套 Lean 驗證器重查後確認 144 題,凸顯形式化基準仍會受到規格與檢查器差異影響。
代理評測
IBM 的 VAKRA 將 API、文件檢索及自然語言政策放進同一條可執行軌跡,最強模型在不同 API 介面上的完整正確率只有 50% 至 70.4%。當政策令問題無法回答時,部分模型的成功率更降至 2.4%。
AI 代理/評測
微軟研究院等團隊以有、無技能的成對軌跡,確認 125 個功能失敗及 182 個效率退步案例。問題通常不是技能不相關,而是代理把通用範例、驗證清單或環境假設誤當成任務硬性要求。
開放權重模型/本機推論
InclusionAI 公開 7.9B 參數的 Ling‑3.0‑tiny,混合線性注意力與稀疏 MoE,並提供 BF16、FP8 及 INT4 權重。官方稱 FP8 在 M4 Pro 可達每秒 86 至 90 token,但 vLLM 與 Ollama 支援目前仍未完全進入上游穩定版本。
AI 評測與開發工具
DashArena 以 234 項開放式任務評測模型生成的互動資料儀表板,並用瀏覽器實際重播模型自行撰寫的操作流程。加入互動證據後,8B 視覺評審與人類偏好的一致率由 71.7%升至 79.8%,但最佳模型仍只有 73.3%的完整重播率。
AI 安全與多代理系統
IO Factory 將敘事規劃、代理發文、平台曝光、受眾狀態更新與基準比較串成可追溯的模擬生命週期。系統已在十萬名模擬平民及一萬名操作代理的設定下完成執行,但所有影響數值都來自人工配置規則與 LLM 評審。
代理記憶與搜尋
ReTree 把搜尋代理的摘要、證據來源與修訂歷史存成依賴樹;新資料推翻舊前提時,系統會回到引入錯誤的節點並刪除受影響分支。四項搜尋基準顯示它同時縮短每步上下文並改善答案,但硬式剪枝可能丟失其實不受衝突影響的資料。
推理與檢索
ThinkRetrieve 不再只要求模型延長思考,而是在每個推理邊界檢索相似題目的完整解答,插入下一段思考脈絡。五款 1.5B 至 8B 模型均勝過循序式測試時計算,但方法需要龐大且嚴格去污染的解題資料庫。
模型可解釋性
海德堡大學研究發現,稀疏自動編碼器的單一 latent 雖可解讀,整組啟用 latent 卻不穩定地對應人類概念。只在名詞前加入相容形容詞,原有啟用集合便可能消失兩成至六成,限制以集合重疊解讀模型狀態的可靠性。
AI 代理與開發工具
SKILLER 不更新小模型權重,而是讓強模型根據執行軌跡與驗證器回饋反覆修改文字技能。Qwen3.5‑9B 在 SWE‑Skills‑Bench 的三次執行平均分數由無技能時的 26.2% 升至 82.8%,但技能生成仍依賴 GPT‑5.4 與成功參考軌跡。