AI inference and observability
WitProbe 為四類注意力記憶建立執行期風險帳本,1,240 萬次讀取未超出預算
新研究以具型別的誤差契約統一監測 KV cache、潛在快取、稀疏選擇器與遞迴狀態,並用 Lean 檢查可形式化的組合規則。公開儲存庫能重建論文數字與 67 項定理,但不含架構專用探針及完整服務平台。
Archive
共 972 篇技術新聞
AI inference and observability
新研究以具型別的誤差契約統一監測 KV cache、潛在快取、稀疏選擇器與遞迴狀態,並用 Lean 檢查可形式化的組合規則。公開儲存庫能重建論文數字與 67 項定理,但不含架構專用探針及完整服務平台。
AI coding agents
CodeGrep 先以平行 grep、glob 與檔案讀取縮小修改範圍,再把候選檔案交給凍結的 OpenHands 程式代理。它在 SWE-bench Verified 維持約 27% 修復率並降低推理成本,但模型與訓練管線尚未公開。
模型訓練與對齊
RRC 不再把偏好 token 的機率直接當獎勵,而是從候選答案的相對排序建構分數。8B 獎勵模型配合八次投票時,ArenaHardV2 亦由 8.0% 提高至 11.2%,但代價是額外的獎勵模型推論。
電腦視覺與具身 AI
HOPE 將觸覺手套、平面感測器與純接觸標註統一映射到 MANO 手部網格。它能從普通 RGB 影片輸出逐頂點壓力與接觸,但公開頁面目前仍標示程式及模型「即將推出」。
新基準在保持目前請求、工具集合與正確動作不變的情況下,只插入已失效但看似合理的歷史紀錄。Oracle-OPD 將 Qwen3-1.7B 的平衡工具使用準確率提高至 87.0%,但驗證範圍仍限於合成的零售與航空情境。
RAG 與文件工程
READ 以詞彙搜尋、結構導覽及區段讀取取代固定分塊與向量 Top-K,讓每次取證都可重播。它在一份 780 頁財務報告上大幅領先密集檢索,但樣本小、成本較高,且證據不足以宣稱代理搜尋優於傳統詞彙索引。
電腦視覺
CogVis 將跨時間影像比較與文字類別判斷拆開,使多個開放詞彙查詢可重用同一份場景變化特徵。作者在七套基準報告領先結果及 28.5% 吞吐量增益,但模型權重並未隨程式碼發布。
代理訓練
AgentOPSD 將教師與學生的機率差異累積成逐回合信念更新,用來辨識真正左右任務成敗的決策。作者報告它在三類代理環境優於 GRPO 與多種自我蒸餾基線,但公開儲存庫目前仍未提供訓練程式。
GUI 代理/世界模型
AppDeltaWorld 不直接生成下一張螢幕截圖,而是先檢索動作可達的版面,再產生 HTML 差分並補入合成圖片。它能建立封閉迴圈訓練軌跡,但目前成效仍依賴自建評分與未公開的完整實作。
具身 AI/評測
GAUGE 將物理引擎與生成式世界模型放到同一套實測基準,從軌跡、方程形式及物理參數分別診斷誤差。結果顯示,畫面合理或符合方程形式,仍不代表加速度、動量轉移與振盪週期正確。
AI 評測與後訓練
MIST 不只測試模型能否抵抗錯誤提示,也檢查它是否仍會採納正確的外部資訊。配套方法 SCOPE 將 Qwen3-4B 的正確轉錯誤率由 35.0% 降至 16.3%,但目前只在兩個小型開放模型家族完成訓練驗證。
AI 代理與開發工具
新研究把 API schema 編譯為具型別的 Python stub,讓模型在單次推理中以程式串接或平行呼叫工具。方法在 BFCL v4 子集多數模型不輸原生 JSON,但目前只測到回傳參數的模擬工具,尚不能證明真實 API 工作流同樣受益。