代理評測/可觀測性
AFANet 以 6.5 萬可訓練參數診斷多代理故障,域內推論由 199 秒縮至 1.16 秒
AFANet 把代理對話轉成含時間及同代理連線的圖,再以兩層 GCN 判斷故障代理與錯誤類型。它在 AEGIS-Bench 勝過多款 LLM 基線,但跨資料集的代理—錯誤配對 F1 仍偏低。
Archive
共 964 篇技術新聞
代理評測/可觀測性
AFANet 把代理對話轉成含時間及同代理連線的圖,再以兩層 GCN 判斷故障代理與錯誤類型。它在 AEGIS-Bench 勝過多款 LLM 基線,但跨資料集的代理—錯誤配對 F1 仍偏低。
RAG/深度研究代理
DeepWeaver 以 Thought Block Chain 整理主張、關鍵資訊與來源,再反覆檢查尚未利用的證據。它改善多款模型的長篇回答與引用指標,但新評測集中於中文水環境問題,程式碼也尚未真正釋出。
推論系統
Liquid AI 釋出三款約 3 億參數的 DSpark 草稿模型,讓 LFM2.5 以推測解碼一次驗證多個候選 token。單批、貪婪解碼測試最高加速 3.18 倍,但 SGLang 支援仍在開放中的 PR,部署成熟度有待驗證。
AI 程式代理
SkillForge 在真實工單出現前,先從測試覆蓋的執行路徑製造可驗證故障,再把修復軌跡蒸餾成專案專屬技能。搭配 Mini-SWE-Agent 後,DeepSeek-V3.2 與 GPT-5-mini 的 SWE-bench Verified Pass@1 分別升至 72.2% 與 60.6%。
模型後訓練
Open-MOPD 發現,多教師在線策略蒸餾的主要瓶頸並非教師梯度衝突,而是不同領域分到的有效 token 更新量嚴重失衡。它結合 token 份額平衡、差距導向配置與學生回報刷新,在單一 3B 模型中追回 83.4% 的可用能力增益。
科學機器學習
Monroe 把稀疏圖注意力、立體化學邊與 1,152 項預訓練目標結合,再以 TabPFN 對凍結分子向量作情境內預測。它在 28 項 Polaris 任務均屬統計最佳組別,但「100% 勝率」包含與最佳方法無顯著差異的平手。
代理與強化學習
SPADE 以提示前後的回報差訓練環境設計者,讓課程隨代理能力自動變難。Qwen3-30B-A3B 在工具使用評測最多增加 13.9 點,但環境驗證器仍可能接受規格不完整或無解的任務。
強化學習與邊緣 AI
VSPG 把每個動作存成單位超向量,將 softmax policy gradient 化為優勢加權向量疊加及正規化,不需 actor 的自動微分或最佳化器狀態。它在兩種建築控制氣候取得較佳回報並較耐位元錯誤,但效能高度取決於固定編碼器。
代理評測
FM-Bench 以 26 種工具及約 340 至 400 個決策點,測試代理能否承受延遲回報、隱藏資訊與競爭者反應。15 款模型均完成 20 年賽程,但排名到後期才穩定,自主管理記憶亦出現只增不刪或反覆覆寫兩種失敗模式。
AI 安全/多模態模型
新研究毋須對完整多模態模型反向傳播,只調整輸入影像,使視覺編碼器的表示偏離原圖或逼近指定目標。四款開放 VLM 的非定向攻擊成功率均逾 93%,但評分依賴單一 LLM 裁判,且尚未測試黑箱轉移能力。
模型架構與代理工具使用
研究讓同一組 Transformer 層在生成每個 token 前反覆更新隱藏狀態,並以相同資料及 LoRA 設定比較循環與一般模型。提升集中在平行呼叫及跨呼叫依賴;以單一 API 呼叫為主的 API-Bank 則未呈現一致優勢。
AI 安全與代理系統
新研究把代理間未寫入對話紀錄的連續向量,與其後公開動作綁定至同一事件,再以異常、反事實影響及稀疏特徵三層檢查。平均 0.993 的結果混合了文字與潛在串通樣本,且攻擊由研究者預先設計,尚不能視為對自發密謀的通用偵測能力。