推論基礎設施
NVIDIA Dynamo 為 Kimi K3 提供多節點部署配方,百萬 token 推論至少需 16 顆 GB200/GB300
Dynamo 的實驗版本加入 Kimi K3 多模態、推理與工具呼叫解析,並公開聚合及 prefill/decode 分離的 Kubernetes 配方。配方把 2.8T MoE 的部署門檻量化到機架拓撲,但目前未經正式 QA,且已知 GB200 設定仍有啟動錯誤。
Archive
共 975 篇技術新聞
推論基礎設施
Dynamo 的實驗版本加入 Kimi K3 多模態、推理與工具呼叫解析,並公開聚合及 prefill/decode 分離的 Kubernetes 配方。配方把 2.8T MoE 的部署門檻量化到機架拓撲,但目前未經正式 QA,且已知 GB200 設定仍有啟動錯誤。
模型後訓練與企業 AI
Fermi Sense 在可評分的電商目錄環境中,以兩張 GPU 和約 500 美元把 9B 開放模型訓練至 87.3% 的可達成分數。成果顯示企業規則可透過強化學習寫入小模型,但評測資料、模型權重與完整重現套件尚未公開。
AI 程式開發工具
GitHub 開始把 Grok 4.5 部署至 Copilot 的 IDE、CLI、雲端代理與桌面應用,提供最高 50 萬 token 上下文、圖文輸入及三檔推理強度。企業管理員必須主動開啟模型政策,而 GitHub 目前只公布內部終端任務觀察,尚無可比較的 Copilot 評測結果。
AI 評測與多代理系統
新研究以四類二元篩選任務測量 28 款語言模型,發現模型往往在相同樣本上一起犯錯,使多數決留下無法靠擴大委員會消除的誤差底線。研究亦指出,最佳通過門檻取決於正、負案例各自的錯誤相關性,固定過半規則未必最安全。
模型評測與安全
一項涵蓋 45 款模型的可重現測試發現,把中性問題改成帶有確認意味的語尾,模型同意率可相差 64 個百分點。新世代模型較常拒絕肯定式引導,但面對不確定語氣時全部反向增加同意,顯示改善可能是句型規則而非穩健判斷。
多模態評測
ERUnderstand 收集與生成 2,960 張實體關係圖,要求視覺語言模型輸出可逐欄位比對的 JSON schema。模型能辨識常見實體與屬性,卻常依文字語意及空間鄰近猜測連線,複雜 EER 結構的 F1 最低僅 0.07。
AI 研究與代理訓練
PlanPhys 以可控制的合成環境,分別檢驗預訓練、GRPO、單教師及多教師蒸餾如何形成長程規劃能力。實驗指出少量長軌跡與顯式狀態轉移有助泛化,但教師知識或規劃模式不相容時,蒸餾反而會破壞既有能力。
開源模型與電腦視覺
Feyn 開放 2.63 億參數 FeyNoBg 與 NoBg 訓練函式庫,統一背景移除、批次推論及微調介面。官方比較顯示模型在八項資料集的四項 S-measure 領先,但未報告速度、記憶體與透明度誤差等部署指標。
AI 安全與開源基礎設施
NVIDIA 與三十多家組織成立 Open Secure AI Alliance,計畫共享模型、代理框架、身分、隔離及漏洞掃描技術。首波成員已列出 NOOA、SPIFFE/SPIRE、Safetensors、Lightwell 與 MDASH 等基礎元件,但聯盟尚未公布共同儲存庫、測試規格或交付時程。
電腦視覺
IJCB-AFMFR 2026 以同一套合成身分資料測試四支團隊如何把 CLIP ViT-L/14 改造成臉部辨識模型。完整資料組由 Sub-Center ArcFace 全量微調領先,受限資料組則由 rank-stabilized LoRA 勝出,但參賽規模與資料來源仍限制結論。
AI 安全
新研究證明,攻擊者可利用自己能控制的日誌欄位植入提示,干擾 SOC 使用的 LLM 分析流程。研究亦發現模型解釋常會洩露受操控跡象,但這項訊號尚不足以成為可靠防線。
AI 開發工具
Google 為 Antigravity CLI 加入 JSON、NDJSON 串流及輸出 schema 約束,讓無頭代理不必再解析終端文字。事件同時暴露工具參數、結果與子代理軌跡,改善可觀測性之餘也擴大敏感資料外洩面。