代理訓練
MidTool 釋出 203 億 token 工具中訓練集,4B/8B 模型在三類代理測試均獲益
MidTool 把 API、MCP、文件、程式碼與合成工作流放進預訓練後、SFT 前的專門階段。資料集與模型檢查點已公開,但深度搜尋測試仍為零分,顯示學懂 schema 不等於具備長程研究能力。
Archive
共 959 篇技術新聞
代理訓練
MidTool 把 API、MCP、文件、程式碼與合成工作流放進預訓練後、SFT 前的專門階段。資料集與模型檢查點已公開,但深度搜尋測試仍為零分,顯示學懂 schema 不等於具備長程研究能力。
推論系統
FreeToken 不採固定卸載,而是按實測頻寬決定把未命中專家傳入 GPU 或直接交給 CPU 計算。論文亦展示單張工作站 GPU 服務 753B 模型,但完整權重仍需主記憶體,不能解讀成「753B 全放進一張卡」。
AI 安全與開發工具
Enterprise 用戶現在可用 Mythos 5 掃描程式庫,取得 CWE 分類、嚴重度、信心評級與建議修補。模型仍藏在受控服務後方,修補必須由人員審核,但 Anthropic 尚未公布偵測準確率。
代理系統與評測
AVO 以持久記憶、監督代理及文字網格介面,讓 Claude Opus 5 在 6,624 次環境動作內完成全部公開關卡。100 分只涵蓋公開集,不能視為通過半私有或私有競賽測試。
AI 編程工具與安全
新版強制部分 Claude Code 網頁工具請求通過工作階段網路代理,也修補代理環境、MCP 重連與敏感輸入處理問題。它同時加入 Python SDK 遷移指令,但 Anthropic 未公布漏洞嚴重度或受影響規模。
生成式視覺與 4D 重建
系統以固定長度參考上下文及擴散期間的視角重組,減少分批生成多視角影片時的結構漂移。權重與推論流程已公開,但完整開源 4D Gaussian Splatting 重建和低記憶體模式仍未完成。
代理協定
MCP 維護團隊把下一階段規格工作集中於五個領域,包括伺服器主動事件、代理身分及漸進式工具探索。這些項目仍是路線圖,現有 SDK 對 Tasks 與擴充通知的支援也存在缺口。
模型訓練基礎設施
Marin 開始訓練總參數 535B、每個 token 啟用約 23B 的 MoE 模型,計畫使用 11 套 GB200 NVL72 處理約 18T 至 18.75T token。專案公開設定、縮放實驗與即時遙測,但模型品質、長上下文方案及最終 token 預算仍未定案。
音訊模型
Imperial College London 團隊以因果 Transformer、stop-gradient 與餘弦損失簡化音訊自監督預訓練。方法在六項分類測試呈現穩定擴展,但尚未證明可泛化至 ASR、生成任務或非 AudioSet 語料。
模型訓練
北京智源研究團隊提出三階段後訓練方法,讓模型不經 RAG 也能回答固定文件集的問題。八組實驗中有七組全面勝過一般 SFT,但成果仍依賴合成問答、模型裁判及逐模型調參。
多模態模型與 API
DeepSeek 為 V4-Flash 加入圖片理解,可透過三種相容介面處理文字與影像,並維持原有 Flash 計價。官方公布的代理評測成績仍缺乏獨立重現,模型權重與視覺架構也未公開。
代理框架與上下文基礎設施
新版把代理技能集中存放、搜尋及快取的流程接入 VikingBot,也加入逐使用者記憶擷取政策與持久化背景匯入。升級同時刪除實驗性的關係 API 與 CLI 指令,既有整合須先遷移。