AI 開發工具
NVIDIA 推出 CUDA MCP 與自託管 Nsight Blueprint,四模型後端可留在內網
Nsight AI 現在可把即時 CUDA 文件接入 Codex、Claude 等 MCP 用戶端,或在本地部署完整的程式輔助後端。開源 Blueprint 結合生成、補全、嵌入及重排模型,但參考配置需要 Hopper 級 GPU 與至少 200GB 儲存空間。
Archive
共 962 篇技術新聞
AI 開發工具
Nsight AI 現在可把即時 CUDA 文件接入 Codex、Claude 等 MCP 用戶端,或在本地部署完整的程式輔助後端。開源 Blueprint 結合生成、補全、嵌入及重排模型,但參考配置需要 Hopper 級 GPU 與至少 200GB 儲存空間。
開放模型
Ornith 釋出 9B、35B MoE 與 397B MoE 三種開放權重模型,訓練迴圈同時最佳化任務、代理鷹架與解題軌跡。397B 的程式代理成績接近閉源前沿模型,但數字尚未經獨立重現,模型發布文件亦存在授權缺口。
代理平台
Anthropic 的新版工具可在一次模型回合執行多個介面動作,並結合頁面結構、可版本化技能及持久檔案。既有 beta 整合仍可運作,但升級電腦操作工具會改變請求格式,工程團隊也須自行處理瀏覽器隔離與提示注入風險。
代理評測
NVIDIA 把原用於 GPU 核心演化搜尋的 AVO 代理架構移植至互動推理,搭配 Claude Opus 5 取得 100.00 RHAE。結果顯示代理記憶與驗證迴圈可大幅改變同一模型的表現,但只涵蓋公開環境,且與 VISTA 的比較不是受控消融。
代理安全
PolicyGuide 不只在工具呼叫前阻擋違規動作,而是在每個使用者回合追蹤尚未完成的政策步驟。它在三個 τ²-bench 領域提高可靠成功率,但每回合增加一次 LLM 驗證,且程序合規指標部分由作者自行設計。
推論系統
Google DeepMind 將是否執行昂貴模型評分寫成「潘朵拉盒」搜尋問題,按資訊價值逐一決定是否加算評估。三種測試中,它都取得最低的平均路由遺憾加評估成本,但效果依賴已校準的訊號分布與成本設定。
AI 開發工具
Modular 在 Mojo 1.0 發布一週後,將 KGEN 編譯器、工具與標準函式庫以 Apache 2.0 加 LLVM 例外條款公開。原始碼已可檢視及自行建置,但編譯器暫不接受外部貢獻,MAX 亦維持獨立授權。
AI 晶片與邊緣推論
Waymo 首度披露 Robotaxi 的異構運算架構,自研 ASIC 負責即時整理相機、光達與雷達資料,再交給核心推論引擎。1,000 TOPS 未標示數值精度與功耗,不能直接與 NVIDIA 或 Tesla 的整車平台比較。
模型訓練與推論效率
新研究把 NoThink、Short 與 Long 變成模型生成的首個 token,毋須另設路由器即可逐題分配推理預算。方法在 MATH-500 維持接近基礎模型的準確率,並在較簡單的 GSM8K 減少 76% token。
代理記憶與評測
一項跨九款模型、三套長流程評測的研究顯示,從完整任務歸納的技能通常令代理退步,從子任務歸納則平均帶來增益。自然語言流程筆記也比可執行 Python 技能更穩定,但效果仍高度依賴模型與評測。
模型產品
8 月 21 日前後,DeepSeek Pro 灰測消息在開發者社群延燒;目前可確認的是官方 8 月 21 日公告只發布 Flash Vision 實驗模型,Pro 仍未公布新版本號。社群觀察到的「I’m doing」思維鏈與 B 站實測,更像一次小範圍路由或後端模型灰度放量。
代理記憶與評測
MemTrapBench 不測記憶能否被找回,而是測正確、相關的舊經驗會否把模型鎖進錯誤策略或信念。五種記憶方法在兩款模型上均不如無記憶基線,簡單提示式護欄則只能追回部分損失。