AI 程式代理與強化學習
DiDPO 把程式 diff 拆成信用單元,Qwen2.5-Coder-7B 主要評測平均升至 48.4%
DiDPO 不再把整次代理執行的成敗平均分配給所有 token,而是比對多條軌跡中的相似子 diff。公開的 verl-code 已包含訓練入口與資料配方,但尚無作者模型 checkpoint,實驗也不是完整軟體庫修復。
Archive
共 972 篇技術新聞
AI 程式代理與強化學習
DiDPO 不再把整次代理執行的成敗平均分配給所有 token,而是比對多條軌跡中的相似子 diff。公開的 verl-code 已包含訓練入口與資料配方,但尚無作者模型 checkpoint,實驗也不是完整軟體庫修復。
AI 研究與科學代理
P-Bench 要求代理自行選擇統計方法、執行 R 程式並回報 p 值,不再只檢查程式能否執行。14B 模型在困難題的嚴格指標領先所列開放模型,但目前公開儲存庫仍只有說明文件。
推論系統
社群部署配方在單台 DGX Spark 上啟用 CUDA Graph 與一層 MTP 推測解碼,把 Ling-3.0-flash INT4 的生成速度由 20.8 提至 38.7 token/s。更關鍵的發現是主線 vLLM 尚未支援 V3 架構,強行套用舊注意力路徑不一定報錯,卻可能輸出看似流暢的錯誤內容。
多模態模型
MiniMax H3 將文字、圖片、影片與音訊封裝成單一序列,聯合預測視覺及音訊 latent,輸出最高 768p、24 FPS、32 kHz 立體聲。官方工作流程宣稱可再生至 2K,但提示編排與高解析度模組仍只提供託管 API。
AI 代理與評測
Scale AI 將提示、工具、記憶與控制流程視為可由模型修改的程式,並以隱藏測試集衡量實際增益。111 次實驗顯示,原生編碼代理並未穩定勝過共用外殼,驗證階段看到的最佳分數也普遍偏樂觀。
AI 代理訓練
CalibForge 不再保留所有能執行的合成題,而是反覆修改任務,直到不同求解代理出現預定的成功與失敗關係。用校準軌跡微調的兩款模型在三項程式代理基準均有增益,但完整訓練需要 64 張 H20,且部分結果只執行一次。
AI 評測與安全
新基準用四種配對情境區分模型是正確判斷證據,還是索性忽略所有外部資訊。SCOPE 只改造 DPO 的偏好資料配置,降低錯誤情境造成的答案翻轉,同時維持正確與無關情境下的準確率。
時間序列與檢索增強
百度研究者把 RAG 從文字生成移植到多變量時間序列,以 TCN 檢索相似片段,再用交叉注意力融合。加入通道依賴的版本在六套資料集優於所列基線,但程式尚未公開,採用的傳統基準也已被維護者警告可能失去鑑別力。
多模態評測
擴充版 Low Frequency Trap 以 2,190 段可程式化影片,把事件數量與頻率分開測量。Gemini 3.6 Flash 的彈球計數準確率隨取樣增加而上升,但時間戳序列 F1 反而只有 3.7%。
多模態評測
新研究以反事實裁切測試六款開放模型,區分「呼叫工具」與「工具回傳內容實際改變答案」。多數正向增益集中在少數校準良好的軌跡,單看最終準確率可能高估視覺工具能力。
代理強化學習
EnvACE 在訓練時不查詢外部環境,而由同一策略交替產生工具動作與想像中的環境回應。它降低建立可執行訓練環境的依賴,但也把模擬錯誤直接吸收到代理參數中。
模型訓練
DASH 不再等量處理每個 token 的師生差異,而是根據整段推理中的分歧變化調整監督範圍。三種 Qwen3 規模均優於同條件 OPSD,但最佳 checkpoint 由測試基準平均分挑選,可能高估泛化增益。