代理訓練研究
Environment Evolution 離策略提升終端訓練難度,兩款 Qwen 代理增加 14.4、18.0 個百分點
騰訊混元等研究者讓終端環境依情境新穎度、技能稀有度與執行長度逐代變難,無須持續以受訓模型的 rollout 尋找弱點。200 步強化學習實驗優於共演化基線,但目前只有作者結果,且尚未公開完整重現套件。
Archive
共 937 篇技術新聞
代理訓練研究
騰訊混元等研究者讓終端環境依情境新穎度、技能稀有度與執行長度逐代變難,無須持續以受訓模型的 rollout 尋找弱點。200 步強化學習實驗優於共演化基線,但目前只有作者結果,且尚未公開完整重現套件。
AI 代理與安全
AAIF 旗下開源代理 Goose 1.49 允許 `PreToolUse` 政策在執行異常時拒絕工具呼叫,避免安全檢查失效後繼續操作。新版也加入穩定的 `tool_call_id` 與結果事件,但預設仍採 fail-open,管理者必須明確調整設定。
模型與開發者平台
Google 將 Gemini 3.8 Flash 正式投入生產,提供 100 萬 token 上下文、三段思考強度及內建工具,並改為 Antigravity 受管代理的預設模型。程式評測有所提升,但多數數字仍由 Google 提供,模型卡也揭露非英語安全評測相對退步。
AI 資安
Cloudflare 的早期預覽服務把原始碼分析結果與實際路由、流量、WAF 狀態及攻擊事件結合,再由 GPT-5.6 Cyber 驗證漏洞和修補方案。模型不直接修改環境,但資料會送至 OpenAI 執行推論,且官方尚未公布誤報率或修補成功率。
AI 基礎設施
HyperPod InstantStart 將 EKS、GPU 容量、訓練、推論與儲存操作編排成可重試的有狀態流程,再透過 MCP 工具交給代理執行。代理不直接操作 AWS CLI,但部署者仍須自行承擔 IAM、Kubernetes、網路與跨服務成本管理。
電腦視覺
Scal3R 保留 CUT3R 或 STream3R 的凍結主幹,改由輕量查詢 token 對多個歷史關鍵幀估計相對位姿,再交給線上位姿圖最佳化。作者在 KITTI 報告平均 ATE 較最強線上對手低逾 60%,但成績經 Sim(3) 對齊,不能直接解讀為保留真實尺度。
語音模型
Microsoft Research 的串流語音模型交錯處理音訊區塊、短暫前視與既有逐字稿,直接輸出「誰說了什麼」。公開版本支援十種語言與自訂熱詞,但預期說話者歸屬延遲仍為兩秒,長時間重疊語音也會退化。
推論系統
KAIST 與 Google DeepMind 提出 Declarative Attention,讓現成模型在推理文字中切換全域、聚焦與本地注意力。作者在兩款模型上減少 31.1% 至 52.0% 的 attended tokens,但速度提升仍主要是模型推算,且準確率略有下降。
代理框架與 MCP
Agno 3.0.6 新增無狀態 MCP 傳輸,任何副本都能接手請求而不必設定 session affinity。框架同時加入協定版本協商與 Server Card,但為相容既有部署仍預設使用舊式工作階段模式。
向量資料庫與 AI 基礎設施
Qdrant 1.19.1 針對 TurboQuant 評分加入預取與批次化 SIMD,並減少 HNSW 搜尋及查詢平面的額外配置。新版也強化分片轉移的故障復原,但官方尚未公布涵蓋不同處理器與資料集的整體效能比較。
AI 輔助科學研究
Google Research、HHMI Janelia 與劍橋團隊完成涵蓋腦部及腹神經索的雄果蠅連接體,收錄逾 16.6 萬個神經元。資料與查詢工具已開放,但單一個體的靜態接線圖仍不能直接解釋神經活動或行為因果。
模型與推論系統
智譜公開 320B、每 token 啟用 18B 參數的原生多模態 GLM-5.3-Flash,並以 MIT 授權釋出權重。新架構宣稱較 GLM-5.3 減少三倍注意力計算與 4.4 倍 KV cache,但「Flash」不代表一般工作站能輕易部署。