具身 AI/機器人
FLUX-mimic 以影片生成骨幹預測機器人動作,單張 RTX 5090 將反應時間壓至 101 毫秒
Black Forest Labs 與 mimic robotics 把 FLUX 3 的影片世界模型接上輕量動作解碼器,用同一套表徵處理視覺預測與機器人控制。團隊在軟性零件分揀自測達 95% 成功率,但模型、資料與完整評測尚未公開。
Archive
共 979 篇技術新聞
具身 AI/機器人
Black Forest Labs 與 mimic robotics 把 FLUX 3 的影片世界模型接上輕量動作解碼器,用同一套表徵處理視覺預測與機器人控制。團隊在軟性零件分揀自測達 95% 成功率,但模型、資料與完整評測尚未公開。
資料集/程式模型
Hugging Face 與 BigCode 釋出新一代開放程式預訓練語料,訓練集包含約 1.73 億筆樣本及 4.9 兆個 token。新版不再要求使用者另行回抓原始碼,但授權、資料污染與 15.9 TB 儲存成本仍須由訓練團隊自行治理。
語音生成/推論系統
新研究以 TensorRT 與 TensorRT-LLM 重構 IndexTTS-2 的 GPT、擴散 Transformer 和聲碼器,並加入串流及批次推論。中英文 Seed-TTS 實驗顯示 GPT 最高加速 5 倍,但目前公開材料仍不足以直接重現整套最佳化管線。
開放模型/程式代理
Kwaipilot 釋出 KAT-Coder-V2.5-Dev 權重,將 Qwen3.6-35B-A3B 經 12.7 萬筆樣本微調,再以代理任務強化學習。官方自測在 SWE-bench Verified 達 69.40%,但分數對代理框架與工具配置相當敏感。
代理基礎設施
NVIDIA 更新 NemoClaw 的 DGX Station 與 DGX Spark 安裝流程,避免既有 vLLM 工作負載被意外中止,並改善大型模型下載的憑證與限流處理。版本仍屬 alpha,新增支援的 DGX OS 組合也尚未完成端到端資格驗證。
開發者平台
DeepSeek 已於 7 月 24 日停用 `deepseek-chat` 與 `deepseek-reasoner` 兩個相容名稱,未遷移的 API 請求可能直接失敗。新介面把模型選擇與推理模式拆開,也使升級不再只是替換模型字串。
AI 代理/開源工具
Andrew Ng 團隊公開 MIT 授權的 OpenWorker,將代理迴圈、憑證與對話保留在使用者電腦,並支援雲端或 Ollama 本機模型。它能產生檔案及操作 Slack、行事曆與終端,但「本機優先」不代表資料必然不離開裝置。
模型後訓練/開發平台
NVIDIA 公開一套可重現的託管後訓練流程,讓開發者以 Prime CLI 對 30B MoE 模型執行 100 步 RLVR,再下載或部署 LoRA。示範在 32 道數學題上由 21.9% 升至 90.6%,但樣本小且任務與獎勵高度受控。
開放模型與推論系統
InclusionAI 發布 124B 參數的 Ling-3.0-flash,採 KDA、MLA 與高度稀疏 MoE,面向長流程代理推論。API 已上線,但權重預定 8 月才公開,效能數字現階段無法完整重現。
模型與開發者平台
Google 將 Gemini 3.6 Flash 與 3.5 Flash-Lite 推向穩定 API,分別瞄準複雜代理主模型與高吞吐子代理。官方數據顯示兩者在 token 用量、程式任務和電腦操作上進步,但比較多由 Google 或合作評測方產生,仍需以真實工作流驗證。
模型壓縮與 CPU 推論
Multiverse Computing 公布經壓縮與修復訓練的 Llama 3.3 70B,可透過 vLLM CPU 和 Intel AMX 在 Xeon 6 上服務。官方測試顯示吞吐接近倍增,但每秒不到 4 個輸出 token,且檢查點與原始結果未公開。
AI 安全與推論系統
ResponseGuard 將多模態回覆審查改寫為二元分類,不生成思考鏈,能在串流期間逐句判斷。作者自測顯示回覆偵測優於 3B 推理式基線,但模型權重、訓練程式與資料切分尚未實際上線。