生成模型評測
Open-EA 將視覺生成評測代理縮至 3B,但目前只完整支援 VBench 影片流程
Open-EA 把多輪視覺模型評測軌跡整理成 10,042 筆監督資料,將原本依賴 GPT-4o 的規劃流程移植至本機 EA-3B。模型、資料建構與 runtime 已公開,但「評測時間降至傳統方法 10%」主要來自原始 API 代理,不能直接視為 EA-3B 的普遍效率保證。
Archive
共 970 篇技術新聞
生成模型評測
Open-EA 把多輪視覺模型評測軌跡整理成 10,042 筆監督資料,將原本依賴 GPT-4o 的規劃流程移植至本機 EA-3B。模型、資料建構與 runtime 已公開,但「評測時間降至傳統方法 10%」主要來自原始 API 代理,不能直接視為 EA-3B 的普遍效率保證。
模型訓練與蒸餾
TIDE 不再把高 token 一致率直接視為蒸餾成功,而是分別處理學生過度生成及漏掉教師偏好 token 的問題。強錯配設定下,方法同時把平均回答長度縮短 3.6 倍,但重現完整訓練仍需八張 GPU,且作者未提供 checkpoint。
模型推論與壓縮
ICBQ 不更換量化器,而是讓相鄰 Transformer 區塊的邊界接受第二次聯合校正,減少早期誤差沿深度累積。品質改善的代價是量化時間平均增加 21%,且作者尚未釋出實作。
AI 安全
ElasticBack 把惡意規則藏進 `SKILL.md`,再以自然語句中的特定概念作為啟動開關,毋須修改模型權重。實驗顯示攻擊可避過多種靜態與執行期檢查,但 Claude 上的誤觸率仍達 20% 至 24%。
AI 代理與資料工程
QueryProof 把歧義判定、SQL 白名單與執行後驗證交給確定性規則,只讓模型處理指標解析及 SQL 草擬。它在 80 題凍結測試集勝過未配置相同外殼的 32B 基線,但按題型家族重抽樣後,優勢區間仍跨越零。
模型架構與推論
Matryoshka Language Model Suites 將 500M、1.5B 與 3B 子模型串成可獨立截取的巢狀架構,避免為每個尺寸重複訓練。共享前段層與 KV 快取亦令推測解碼吞吐提高 14% 至 26%,但目前只在 3B 級基礎模型驗證。
AI 程式驗證
P³ 要求代理在寫程式前先統一規劃實作結構、輔助引理與證明分解,避免完成程式後才反覆修補證明。它在三套 Lean 4 基準的全部模型組合均勝過比較流程,但最難的儲存庫任務最高仍只解出 22.2%。
AI 硬體設計
ArchAgent v2 將 L1D、L2 與 LLC 預取器分階段演化,再以即時容量檢查淘汰超出硬體預算的候選。最終設計在 DPC4 模擬環境比人工冠軍 BertiGO 高 0.3%,但尚未經實體晶片驗證。
檢索與推論系統
Tevatron-Elastic 將早退、Matryoshka 向量及層間 token 壓縮統一成可設定的 operating point,一個 checkpoint 可服務多種成本配置。Qwen3‑0.6B 重排序器在第 16 層維持完整品質,同時於作者測試環境加速 1.75 倍。
AI 編程與評測
SWE-Bench ProMax 從 29,782 個候選提交篩出 170 項跨檔案重構任務,並由專家重寫需求及檢查測試。GPT‑5.2 配合 OpenHands 的解題率最高,但軌跡顯示代理常漏改周邊呼叫點、設定與測試檔案。
推論系統與評測
KVDiagnosis 不只比較長上下文總分,而是為每種壓縮設定建立 FullCache 配對,追蹤證據保留、注意力及機率漂移。團隊亦因實作稽核排除 7,800 組結果完全相同的 PyramidKV 紀錄,凸顯跨方法評測容易被轉接器錯誤污染。
AI 安全與代理框架
SHE 把代理安全外殼拆成系統提示、規則庫、安全記憶與工具政策,再依失敗軌跡局部修訂。它在 Agent-SafetyBench 同時降低攻擊成功率與誤拒率,但真實部署仍須防範評分器偏差及規則自我膨脹。