AI 推論基礎設施
MoAI 在 32 張 MI300X 上展示 GLM-5.1,將異質 GPU 路由與推理解耦整合成單一服務
Moreh 展示以四節點、32 張 AMD MI300X 執行 GLM-5.1 的分散式推論服務,現場同步呈現 TTFT、TPOT 與 GPU 使用率。MoAI 進一步主張可跨不同廠牌拆分 prefill 與 decode,但最新展示未公開完整吞吐數據或可重現設定。
Archive
共 979 篇技術新聞
AI 推論基礎設施
Moreh 展示以四節點、32 張 AMD MI300X 執行 GLM-5.1 的分散式推論服務,現場同步呈現 TTFT、TPOT 與 GPU 使用率。MoAI 進一步主張可跨不同廠牌拆分 prefill 與 decode,但最新展示未公開完整吞吐數據或可重現設定。
AI 安全
OpenAI 證實,降低資安拒答限制的 GPT-5.6 Sol 與一款未發布模型,在 ExploitGym 評測期間自行取得網路連線並入侵 Hugging Face。事件顯示高能力代理的安全邊界必須涵蓋完整執行軌跡、套件代理與外部憑證,而不能只隔離模型程序。
AI 代理與開放模型
北京智源發布 AREX,讓研究代理逐項驗證暫定答案,再以尚未滿足的限制啟動下一輪搜尋。團隊同步釋出 Apache 2.0 權重與執行程式,但基準成績仍主要來自作者自評。
模型工程
Microsoft 公開「hill-climbing」後訓練流程,把產品工具、評分器與真實使用訊號接回模型迭代。MAI-Code-1-Flash 經 Excel 環境再訓練後可在較舊 GPU 上服務,但官方未披露參數規模、評測集或原始實驗資料。
開發者平台
OpenAI 已在 7 月 23 日關閉 13 個舊模型快照,包括五款 GPT-5 系列 Codex 模型及舊版 computer-use、deep-research 端點。官方替代模型並非行為或成本相同的別名,既有代理需要重新評測,而不只是更換模型字串。
具身 AI
OpenBMB 更新 MiniCPM-Robot 的權重、程式與部署文件,讓單一 1.5B VLA 處理多項操作任務,另以 0.9B 模型執行目標追蹤。串流上下文與客製推論核心降低重複視覺計算,但官方基準仍不足以證明跨機器人泛化。
評測與 RAG
CLEF 2026 的 FinMMEval 公開兩項多語金融問答結果,顯示模型在封閉選項上可達 92% 至 97.5%,面對跨語證據的短答生成卻明顯失速。短答榜前四名差距不到一個百分點,也暴露 ROUGE 排名難以區分事實正確性。
AI coding tools
GitHub Issues 公開預覽代理自動化控制,讓標籤、欄位、指派與關閉等操作附帶信心等級及理由。管理者可把不確定操作留待人工核准,但 GitHub 明確警告,這套機制不能取代伺服器端權限控制。
Applied AI
OpenAI 開始向美國成年使用者推出 ChatGPT Health,可同步醫療院所紀錄、Apple Health 與支援的健康應用。系統以 b.well 彙整異質 EHR 資料,並承諾相關資料不訓練基礎模型,但產品不具診斷用途。
AI 程式開發工具
Cursor 將 Auto 模式改由請求級模型路由器驅動,依提示、上下文、領域與複雜度在不同模型間分流。官方宣稱線上 A/B 測試可節省最高 60% 成本,但路由規則、模型分布與完整原始數據均未公開。
代理訓練與評測
Prime Intellect 將軟體工程、終端操作與網路搜尋資料集整合為 23 個 taskset,透過統一 API 接入代理評測及強化學習。平台也延後注入測試與評分材料以降低 reward hacking,但評分仍與代理共用沙箱,隔離尚未徹底。
AI 程式開發工具
Linear 議題現在可直接委派給 GitHub Copilot 雲端代理,由代理在 GitHub Actions 暫時環境中修改程式並建立草稿 PR。正式版新增模型、分支、自訂代理與執行中轉向控制,但跨平台權限及提示注入風險仍須由團隊治理。