機器人/世界模型
GeniWorld 將機器人動作渲染成視覺條件,合成資料使實機成功率升至 69.0%
GeniWorld 先以 URDF 將關節動作轉為像素對齊的機器人運動,再讓因果 DiT 預測環境如何回應。作者在四項實機任務報告整體成功率由 40.8% 升至 69.0%,但尚未公開程式與模型權重。
Archive
共 972 篇技術新聞
機器人/世界模型
GeniWorld 先以 URDF 將關節動作轉為像素對齊的機器人運動,再讓因果 DiT 預測環境如何回應。作者在四項實機任務報告整體成功率由 40.8% 升至 69.0%,但尚未公開程式與模型權重。
多模態模型評測
新研究以可執行時間軌跡稽核影片模型,而非只檢查最終計數。Gemini 3.6 Flash 在高事件量、高頻率區僅答對 0.2%,且只找回 18.1% 的真實事件。
代理工程與評測
HarnessOpt-Bench 要求模型在固定評估預算內修改提示、工具、記憶與控制流程,再以不可見測試集計算實際增益。111 組實驗顯示,模型本身造成的差異大於外層 coding harness,但原生工具並未穩定勝出。
代理系統/可觀測性
TrajDebug 不把代理軌跡中的第一個錯誤直接當成根因,而是追蹤錯誤是否修復、留下終局影響及消耗復原預算。團隊以 486 條人工標註軌跡測試,診斷轉成提示後使相同任務重跑成功率平均提高 10.8%。
模型最佳化
研究將 Adam 與低秩恢復差異追溯至逐座標預條件器不具 gauge equivariance。公開實驗中,兩個功能等價初始化經 Adam 訓練後,其注意力不變量相差 56%,但結論尚未經大型模型預訓練驗證。
模型訓練與推理
DASH 不再等量處理每個 token 的教師—學生差異,而是依整條生成軌跡調整監督可向前傳播的距離。作者在三項數學基準報告穩定增益,並公開訓練程式、評測流程與 LoRA 權重。
Reasoning Core 用可執行評分器、難度控制與短答案格式產生數學、規劃、形式證明及程式題。匹配訓練實驗顯示它優於三套程序資料集,但作者也在外部資料庫發現生成器與評分器不一致。
AI 程式代理研究
新研究區分常駐的 AGENTS.md 與針對單一任務的 Agent Plan,檢查計畫如何進入公開版本歷史。樣本高度集中於少數專案,顯示「計畫即協作產物」仍是早期且不穩定的實務。
AI 程式開發工具
Muse Code 將 Muse Spark 1.2 包裝成終端機代理,能在隔離 worktree 內平行處理大型程式庫。其附加式事件日誌可在程序中斷後重建狀態,但效能數字主要仍由 Meta 自行提供。
AI 評測與安全
新評測在 MCP 工具清單植入語意誘餌、參數陷阱與能力幻象等定向探針,藉錯誤呼叫定位代理的選擇弱點。11,520 次實驗顯示模型等級不能穩定預測安全性,而受騙後能否自行退出,會把任務成功率由 16% 拉升至 52%。
AI 代理與開發工具
Argus 把長期任務拆成受限 mission,並由 Manager、Planner、Engineer 與 Reviewer 共同維護可持久化狀態。作者報告它以 1.41 倍 token 成本提高程式修復成績,代理產生的 RWKV6 核心亦經外部修正後合併至開源專案。
推論系統
ReCo 依每個推理步驟的程序獎勵動態壓縮 KV cache,同時抑制重複反思並提早停止。三款推理模型、六項基準的作者實驗顯示,生成 token 減少 37% 至 65%,延遲改善 2.08 至 2.35 倍。