返回首頁

AI 開發工具

NVIDIA 推出 CUDA MCP 與自託管 Nsight Blueprint,四模型後端可留在內網

Nsight AI 現在可把即時 CUDA 文件接入 Codex、Claude 等 MCP 用戶端,或在本地部署完整的程式輔助後端。開源 Blueprint 結合生成、補全、嵌入及重排模型,但參考配置需要 Hopper 級 GPU 與至少 200GB 儲存空間。

Strubbl · CC BY-SA 4.0 · Image source
zh-Hant

NVIDIA 擴充 Nsight AI,將 CUDA 程式輔助拆成三條路徑:由 NVIDIA 託管的 CUDA MCP Server、可自行部署的 Nsight Copilot Blueprint,以及直接嵌入 Nsight Compute 的效能分析助手。MCP 端點可接入 Codex、Claude 或其他相容用戶端,讓代理搜尋 NVIDIA 維護的 CUDA 文件與程式範例,而非只依賴模型訓練截止日前的知識;首次連線仍須使用 NVIDIA Developer 帳戶驗證。

較具技術實質的是 Apache 2.0 授權的自託管 Blueprint。其聊天與 RAG 生成層使用 gpt-oss-120b NIM,低延遲補全使用以 Qwen2.5-Coder-7B 為基礎的 CUDA-autocomplete,另以 BAAI bge-m3 建立文件向量,再由 llama-nemotron-rerank-1b-v2 重排。服務層由 vLLM、LiteLLM、FastAPI 與 Bodhi Tree RAG 組成,對外提供 OpenAI 相容串流介面及 `search_cuda_docs` MCP 工具;預設 Docker Compose 配置可讓提示、原始碼和推論留在本機。

硬體門檻並不低。參考部署是具 128GB 統一記憶體的 DGX Spark;一般伺服器則需要一張至少 80GB 的 GPU承載主模型,再配置第二張 GPU執行補全、嵌入與重排,或使用約 100GB 以上的單一 GPU。主模型採 MXFP4,要求 Hopper 或更新架構,A100 即使記憶體足夠也不受支援,磁碟另需至少 200GB。

這項發布把文件檢索、程式生成與 profiler 診斷接到同一工作流,對處理未公開 kernel 的團隊尤其有用。不過 NVIDIA 尚未公開足以比較通用程式代理的完整 ComputeEval 結果;AI 建議也不能替代編譯、數值驗證與 Nsight 指標。Blueprint 程式碼雖開放,下載的 NIM、模型與 CUDA 文件仍各自受不同授權約束,且專案目前不接受外部程式碼貢獻。

來源

  1. NVIDIA Nsight AI
  2. NVIDIA AI Blueprint: Nsight Copilot