AI 程式開發與治理
GitHub 將 Copilot App 與雲端代理納入中央政策,外掛與核准繞過可跨客戶端鎖定
GitHub 的 `managed-settings.json` 現在同時約束 Copilot App、雲端代理、CLI 與 VS Code,並把桌面 App 的啟用權限從 CLI 政策分離。既有企業預設仍會啟用 App,管理員若要求封閉式導入,需要主動檢查新政策及外掛白名單。
Archive
共 977 篇技術新聞
AI 程式開發與治理
GitHub 的 `managed-settings.json` 現在同時約束 Copilot App、雲端代理、CLI 與 VS Code,並把桌面 App 的啟用權限從 CLI 政策分離。既有企業預設仍會啟用 App,管理員若要求封閉式導入,需要主動檢查新政策及外掛白名單。
AI 標準與代理基礎設施
MCP 新修訂移除初始化握手與 `Mcp-Session-Id`,讓單次請求可由任一伺服器實例處理。這是破壞性協定變更;在最終版與主要 SDK 完成同步前,部署者仍須保留版本協商及舊版回退。
代理框架與開發工具
NOOA 將代理表示成單一 Python 類別,以方法、欄位、docstring 與型別標註取代分散的提示及工具 schema。官方在 SWE-bench Verified 報告 82.2% 與約一半 token 用量,但框架仍屬研究預覽,執行模型生成程式碼時必須另加沙箱。
開放模型與推論
Moonshot AI 於 7 月 27 日釋出 Kimi K3 完整權重、模型卡與技術報告,外部團隊如今可實際部署與稽核這款三兆級稀疏模型,但至少 64 顆加速器、自訂程式碼及推理歷史相依性也形成明確門檻。
AI 安全
新研究把代理可用權限取角色上限、任務分類及禁止組合三者的交集,避免每項工作都持有完整角色憑證。公開資料集將 600 個企業任務映射至 15 類最小權限,但 93% 改善反映的是政策修訂,不是已部署系統的攻擊攔截率。
開源模型
Nanbeige Lab 公開以 28 兆 token 從零預訓練的 Nanbeige4.2-3B,重複使用同一組 Transformer 層,在不增加參數下提升計算深度。官方代理評測普遍超越較大的 Qwen3.5-9B,但成績高度依賴自家執行框架,仍需獨立重現。
推論與模型服務
SGLang 新版加入 DSpark,依草稿模型信心改變每輪驗證窗口,並把 UnifiedRadixTree 設為滑動窗口、Mamba 與稀疏注意力模型的預設快取。版本也移除數條量化後端及更改 rollout 傳輸格式,升級現有服務前必須檢查相容性。
機器人與世界模型
NVIDIA 公開以少步擴散、自生成歷史蒸餾及串流 KV 快取打造的手術機器人生成式模擬器。系統已能即時接收機器人運動資料並合成下一段畫面,但視覺逼真度仍不能替代物理正確性及臨床驗證。
開放模型與代理
inclusionAI 開放 100B 級 LLaDA2.2-flash,以 Levenshtein Editing 讓平行解碼可插入、刪除及替換內容。模型在部分代理測試與吞吐上勝過自家自回歸基線,但程式修復與函式呼叫準確率仍落後,服務支援也尚未齊備。
推論與基礎設施
vLLM 0.26 讓不同 KV-cache 群組選用各自的注意力後端,並把物件儲存納入分層快取。新版也集中最佳化 DeepSeek-V4、ROCm、XPU 與推測解碼,但官方微基準不能直接代表實際服務吞吐。
代理評測
FluxBench 以統一提示、工具與製程庫測試代理從 RTL 生成一路完成合成、布局繞線及 ECO,而非只評單次程式輸出。作者報告相同基礎模型搭配不同代理框架可出現 86.27% 的效能差距,但商用 EDA 實驗範圍狹窄,論文版本也曾撤回後重發。
AI 評測
ForecastBench 7 月 27 日更新的初步榜單顯示,前三名全由 Torchcast AI 專用代理取得,最高 Brier Index 為 65.6。GPT-5.5 搜尋代理與超級預測者中位數落在相近區間,但題目數、提交時間及置信區間差異限制了直接排名解讀。