# SURL AI News 偏技術的 AI 模型、晶片、開源、研究與基礎設施新聞。 ## Core URLs - Home: https://ainews.surl.tw/ - All articles: https://ainews.surl.tw/articles - RSS: https://ainews.surl.tw/rss.xml - Sitemap: https://ainews.surl.tw/sitemap.xml - Google News sitemap: https://ainews.surl.tw/news-sitemap.xml - MCP: https://ainews.surl.tw/mcp ## Editorial Scope Technical AI news about models, chips, open source, research, developer platforms, inference infrastructure, and AI safety. Articles are rewritten in Traditional Chinese with source links and caveats. ## Recent Articles - [Solar Open 2 以混合線性注意力支撐百萬 token,250B MoE 每次僅啟用 15B 參數](https://ainews.surl.tw/article/solar-open-2-以混合線性注意力支撐百萬-token-250b-moe-每次僅啟用-15b-參數-67ebddcc): 韓國 Upstage 發布面向長流程代理的 Solar Open 2,將 2500 億參數 MoE、混合注意力與百萬 token 上下文整合於同一模型。官方表示量化後可用兩張 NVIDIA H200 部署,但效能與長上下文穩定性目前主要依賴團隊自測。 - [Linus Torvalds 劃清 Linux Kernel 對 AI 的底線:不禁用,也不讓反 AI 立場綁架專案](https://ainews.surl.tw/article/linus-torvalds-劃清-linux-kernel-對-ai-的底線-不禁用-也不讓反-ai-立場綁架專案-9bb3c01c): 在 Sashiko 與 Patchwork 串接討論中,Linus Torvalds 明確表示 Linux kernel 不是反 AI 專案;反對者可以依開源規則 fork,或選擇離開。這不是全面放行 AI 產物,而是把 AI 工具納入既有技術評估:結果要有用、責任仍在人類維護者與提交者身上。 - [AIBTest 推出 MCP 原生 A/B 測試流程,讓代理自行驗證網域、部署 SDK 並讀取成效](https://ainews.surl.tw/article/aibtest-推出-mcp-原生-a-b-測試流程-讓代理自行驗證網域-部署-sdk-並讀取成效-39a34038): AIBTest 把網站 A/B 測試拆成網域驗證、短期憑證、瀏覽器分流與 MCP 報表四段流程,目標是讓 AI agent 不只建議實驗,而是能在受限權限下操作實驗。第一版強調 credential-safe 設計與窄化 DOM 變更面,但目前報表仍以描述性指標為主,尚未宣稱統計顯著性。 - [Anthropic 記憶儲存 API 切換分頁與路徑語義,舊游標及查詢參數可能失效](https://ainews.surl.tw/article/anthropic-記憶儲存-api-切換分頁與路徑語義-舊游標及查詢參數可能失效-6f9348ae): Claude Managed Agents 的記憶列表行為已於 7 月 22 日套用新版規則,包括穩定排序、目錄式前綴比對與受限的查詢深度。這不只是 SDK 換標頭;既有同步程式可能遇到 400 錯誤、漏列項目或游標失效。 - [美國能源部啟動 278 項 AI 科學工作流計畫,串接代理框架、模型與國家實驗室 HPC](https://ainews.surl.tw/article/美國能源部啟動-278-項-ai-科學工作流計畫-串接代理框架-模型與國家實驗室-hpc-eefed17e): Genesis Mission 首批計畫涵蓋核能、關鍵礦物、晶片設計與商用核融合,研究團隊將共用模型、代理框架及高效能運算資源。OpenAI 另承諾 Codex 與 API 額度,支援約 2,000 名研究者及兩項大規模科學實驗。 - [SLAI T-Rex 在 Ascend SuperPOD 全參數後訓練兆級 MoE,MFU 提升至 34.22%](https://ainews.surl.tw/article/slai-t-rex-在-ascend-superpod-全參數後訓練兆級-moe-mfu-提升至-34-22-31b44bf9): 研究團隊針對 DeepSeek-V4 家族重做平行策略、通訊排程、核心與算子融合,使 Ascend 訓練效率達開源基線的 2.93 倍。系統再以求解器驗證資料訓練運籌研究模型,但程式、資料與硬體測量仍需更完整的公開重現。 - [BaseRT 以 Metal 4 直接驅動 M5 神經加速器,提示處理最快勝 llama.cpp 6.4 倍](https://ainews.surl.tw/article/basert-以-metal-4-直接驅動-m5-神經加速器-提示處理最快勝-llama-cpp-6-4-倍-a08dd262): BaseRT 新增手寫的稠密、MoE GEMM 與 FlashAttention 核心,將提示階段的矩陣運算交給 M5 GPU 內的神經加速器。團隊在 M5 Pro 報告顯著領先 llama.cpp 與 MLX,但數據目前仍來自開發者自己的單機測試。 - [SWE-Pruner Pro 直接讀取程式模型隱藏狀態,最多削減 39% 代理 token](https://ainews.surl.tw/article/swe-pruner-pro-直接讀取程式模型隱藏狀態-最多削減-39-代理-token-fe6195bb): SWE-Pruner Pro 不再呼叫獨立分類器,而以輕量預測頭從程式代理的內部表徵判斷每行工具輸出是否保留。研究在兩款開放 MoE 模型與四項多輪基準上取得 token 節省,但需要修改推論伺服器,且部分品質增益尚待重現。 - [RynnBrain 1.1 將接觸點與原生 3D 定位納入具身基礎模型,並跨三種機器人訓練 VLA](https://ainews.surl.tw/article/rynnbrain-1-1-將接觸點與原生-3d-定位納入具身基礎模型-並跨三種機器人訓練-vla-055b7319): 阿里巴巴達摩院發布 2B、9B 與 122B-A10B 三種 RynnBrain 1.1 模型,新增接觸點預測及原生 3D grounding。配套 RynnBrain-VLA 以統一動作空間跨 Unitree G1、Astribot-S1 與天機舞姬訓練,但跨硬體泛化仍主要由團隊自有實驗支持。 - [GitHub 以採用階段重做 Copilot 成效儀表板,但產出量仍不等於工程品質](https://ainews.surl.tw/article/github-以採用階段重做-copilot-成效儀表板-但產出量仍不等於工程品質-0dc60621): GitHub 新增 Copilot impact dashboard,依程式優先、代理優先及多代理等使用階段比較合併速度與產出。新介面讓企業能觀察工具採用深度,但仍缺少缺陷、返工與長期維護成本等品質訊號。 - [Anthropic 將以 AMD Helios 擴充 2 GW 算力,並用 Claude 反向優化 ROCm](https://ainews.surl.tw/article/anthropic-將以-amd-helios-擴充-2-gw-算力-並用-claude-反向優化-rocm-8d9bb247): Anthropic 計畫自 2027 年上半年起部署首批 AMD Instinct MI450 系列 GPU,總規模最高達 2 GW。合作不只是採購硬體,雙方還將以 Claude 優化 GPU 工作負載與 ROCm 軟體堆疊。 - [Thinking Machines 釋出 Inkling:975B MoE 開放權重模型支援百萬 token 與原生多模態](https://ainews.surl.tw/article/thinking-machines-釋出-inkling-975b-moe-開放權重模型支援百萬-token-與原生多模態-8f22024e): Inkling 以 9750 億總參數、410 億啟用參數的 MoE 架構進入開放權重市場。模型同時提供可調推理強度、百萬 token 上下文,以及在 Tinker 上微調的路徑。 - [OpenAI 將 GPT-5.6 分成 Sol、Terra、Luna,統一百萬 token 上下文與代理工具介面](https://ainews.surl.tw/article/openai-將-gpt-5-6-分成-sol-terra-luna-統一百萬-token-上下文與代理工具介面-18bc5ddf): GPT-5.6 家族進入一般供應,以 Sol、Terra、Luna 分別覆蓋最高能力、均衡成本與大量低價工作負載。三款模型共享長上下文與工具介面,但推理成本、安全行為及實際品質仍需分別評估。 - [Grabette 開源低成本機器人示範採集器,把手部操作轉成 LeRobot 資料集](https://ainews.surl.tw/article/grabette-開源低成本機器人示範採集器-把手部操作轉成-lerobot-資料集-89c34a61): Pollen Robotics 發布約 490 歐元的手持式 Grabette,利用雙相機、IMU 與夾爪編碼器記錄六自由度操作。瀏覽器處理流程會執行 SLAM、檢查軌跡並輸出標準 LeRobot 資料。 - [AgentLens 把程式代理評測移到生產軌跡,支援夜間回歸與失敗診斷](https://ainews.surl.tw/article/agentlens-把程式代理評測移到生產軌跡-支援夜間回歸與失敗診斷-3d54af89): AgentLens 不只檢查代理是否解出程式題,而是審查完整互動軌跡與實際產品結果。開源基準可用於比較模型版本、定位行為退化,並接入持續整合流程。 - [OmniaBench 以 1,431 項跨場景任務檢驗通用代理,前沿模型 Pass@1 仍低於六成](https://ainews.surl.tw/article/omniabench-以-1-431-項跨場景任務檢驗通用代理-前沿模型-pass-1-仍低於六成-43ad42ee): OmniaBench 建立具明確狀態空間的跨工具、跨互動形式代理測試,並提供 644 題精簡困難集。結果顯示,規劃、約束維持與錯誤後調整仍是前沿代理的共同弱點。 - [Meta Muse Spark 1.1 開放 Model API,主打百萬 token、平行工具呼叫與多模態代理](https://ainews.surl.tw/article/meta-muse-spark-1-1-開放-model-api-主打百萬-token-平行工具呼叫與多模態代理-c5b476ce): Muse Spark 1.1 首次透過 Meta Model API 公開預覽,並提供 OpenAI 相容介面。模型把百萬 token 上下文、搜尋引用、結構化輸出與平行工具呼叫整合成代理基座。 - [Nunchaku Lite 原生進入 Diffusers,以 W4A4 量化降低擴散 Transformer 顯存與延遲](https://ainews.surl.tw/article/nunchaku-lite-原生進入-diffusers-以-w4a4-量化降低擴散-transformer-顯存與延遲-9ee84eb1): Diffusers 現可直接載入 Nunchaku Lite 的 INT4 與 NVFP4 檢查點,不必另裝模型專用推論引擎。SVDQuant 同時量化權重與啟用值,目標是在節省顯存之外真正縮短去噪時間。 - [NVIDIA Cosmos 3 Edge 以雙 Transformer 塔在 Jetson 上連接視覺理解與機器人動作](https://ainews.surl.tw/article/nvidia-cosmos-3-edge-以雙-transformer-塔在-jetson-上連接視覺理解與機器人動作-e5bcfa8c): Cosmos 3 Edge 是 40 億參數的開放世界模型,可同時進行場景理解、未來預測與動作生成。官方稱其在 Jetson Thor 上每次產生 32 個動作,控制頻率可達 15 Hz。 - [Gemini 3.6 Flash 降低代理輸出 token,用輕量 Cyber 變體擴大漏洞搜尋](https://ainews.surl.tw/article/gemini-3-6-flash-降低代理輸出-token-用輕量-cyber-變體擴大漏洞搜尋-d445558a): Google 同步推出 Gemini 3.6 Flash、3.5 Flash-Lite 與受限存取的 3.5 Flash Cyber。更新把代理系統的成本、延遲與專用資安模型視為同一套部署問題。