AI 推論與編譯器
PyTorch Helion 新增 TPU 後端,以同一套高階核心程式跨接 Triton 與 Pallas
PyTorch 與 Google 為 Helion 建立 TPU 後端,讓 PyTorch 風格的核心程式可編譯成 Pallas,減少另寫 TPU 低階核心的負擔。團隊在 TPU v7 測得 Flash Attention 最高 838 TFLOPs,但功能仍處於積極開發階段。
Archive
共 979 篇技術新聞
AI 推論與編譯器
PyTorch 與 Google 為 Helion 建立 TPU 後端,讓 PyTorch 風格的核心程式可編譯成 Pallas,減少另寫 TPU 低階核心的負擔。團隊在 TPU v7 測得 Flash Attention 最高 838 TFLOPs,但功能仍處於積極開發階段。
AI 開發工具與標準
GitHub MCP Server 已提前支援預定 7 月 28 日定稿的 MCP 2026-07-28 規格。新版把協定核心改為無狀態請求,降低水平擴充成本,但自建客戶端與長任務實作仍須處理多項破壞性變更。
開放模型與生成式影像
Mage-Flow 把輕量 Mage-VAE、原生解析度 MMDiT 與 rectified flow matching 組成 40 億參數圖像模型。Microsoft 已釋出 MIT 授權權重及生成、編輯版本,但品質比較和效率數字目前仍主要來自團隊自評。
AI 安全與評測
ResearchArena 把後訓練、CUDA 核心及推論伺服器最佳化改造成帶有隱藏攻擊目標的長流程評測。384 次實驗顯示,允許監控代理實際執行成品有助於找出後門,但訓練資料內的破壞仍經常漏網。
AI 基礎設施
開源專案 GigaToken 0.9.0 將預分詞、BPE 合併與資料輸入路徑重新最佳化,宣稱在雙路 144 核 AMD EPYC 主機上比 Hugging Face Tokenizers 快 989 倍。最大數字依賴原生 API、11.9 GB 批次語料及高度平行硬體,不能直接套用到線上短請求。
開放權重模型
韓國 Upstage 發布面向長流程代理的 Solar Open 2,將 2500 億參數 MoE、混合注意力與百萬 token 上下文整合於同一模型。官方表示量化後可用兩張 NVIDIA H200 部署,但效能與長上下文穩定性目前主要依賴團隊自測。
開源與 AI 開發工具
在 Sashiko 與 Patchwork 串接討論中,Linus Torvalds 明確表示 Linux kernel 不是反 AI 專案;反對者可以依開源規則 fork,或選擇離開。這不是全面放行 AI 產物,而是把 AI 工具納入既有技術評估:結果要有用、責任仍在人類維護者與提交者身上。
AIBTest 把網站 A/B 測試拆成網域驗證、短期憑證、瀏覽器分流與 MCP 報表四段流程,目標是讓 AI agent 不只建議實驗,而是能在受限權限下操作實驗。第一版強調 credential-safe 設計與窄化 DOM 變更面,但目前報表仍以描述性指標為主,尚未宣稱統計顯著性。
代理基礎設施
Claude Managed Agents 的記憶列表行為已於 7 月 22 日套用新版規則,包括穩定排序、目錄式前綴比對與受限的查詢深度。這不只是 SDK 換標頭;既有同步程式可能遇到 400 錯誤、漏列項目或游標失效。
AI 科學與高效能運算
Genesis Mission 首批計畫涵蓋核能、關鍵礦物、晶片設計與商用核融合,研究團隊將共用模型、代理框架及高效能運算資源。OpenAI 另承諾 Codex 與 API 額度,支援約 2,000 名研究者及兩項大規模科學實驗。
訓練系統
研究團隊針對 DeepSeek-V4 家族重做平行策略、通訊排程、核心與算子融合,使 Ascend 訓練效率達開源基線的 2.93 倍。系統再以求解器驗證資料訓練運籌研究模型,但程式、資料與硬體測量仍需更完整的公開重現。
端側推論
BaseRT 新增手寫的稠密、MoE GEMM 與 FlashAttention 核心,將提示階段的矩陣運算交給 M5 GPU 內的神經加速器。團隊在 M5 Pro 報告顯著領先 llama.cpp 與 MLX,但數據目前仍來自開發者自己的單機測試。