模型發布
Qwen3.8-Max 擴至 2.4T 稀疏 MoE,27B 與旗艦權重預告下週開放
阿里巴巴將 Qwen3.8-Max 推向正式 API,主攻程式開發與長流程知識工作,並預告同步開放旗艦版及 27B 模型權重。模型在社群程式競技場取得前段排名,但架構、啟用參數量與自架成本仍缺乏完整技術文件。
Archive
共 973 篇技術新聞
模型發布
阿里巴巴將 Qwen3.8-Max 推向正式 API,主攻程式開發與長流程知識工作,並預告同步開放旗艦版及 27B 模型權重。模型在社群程式競技場取得前段排名,但架構、啟用參數量與自架成本仍缺乏完整技術文件。
代理安全與執行期授權
CAGE 不只檢查代理當下看到的工具回傳,而是驗證一組可能的正確綁定結果是否全都允許同一動作。研究證明,分別檢查類別欄位與數值誤差並不能保證兩者同時變動時仍安全。
AI 開發工具
GitHub Copilot 用量報表的 `used_copilot_coding_agent` 相容期已於 8 月 1 日屆滿,整合端應遷移至 `used_copilot_cloud_agent`。兩欄位此前回傳相同布林值,但期限後舊欄位不再有保留承諾,可能使企業採用率報表靜默漏算。
AI 安全與開源工具
NVIDIA、Linux Foundation、Hugging Face、Microsoft 等組織成立 Open Secure AI Alliance,準備以開放模型與工具處理代理及 AI 軟體漏洞。首批具體投入包括 NVIDIA 的 NOOA 框架,但聯盟尚未公布共同規格、治理流程與交付時程。
推論系統
VIDRAFT 公開 Fast Gemma Challenge 的最高已驗證配置,讓 Gemma 4 E4B 在單張 NVIDIA A10G 達到 510.58 tokens/s,同時把 perplexity 維持在 2.3930。成果來自多項推論最佳化疊加,但測試是單串流、固定硬體與私有提示集,不能直接等同生產吞吐量。
資料中心基礎設施
北美電力可靠度機構要求輸電規劃與系統營運單位在 8 月 3 日前回報七項運算負載措施,涵蓋模型、穩定度研究、試運轉與動態錄波。這不是一般能源政策宣示,而是要求 AI 資料中心的秒級卸載與功率振盪成為電網工程模型的一部分。
AI 安全/代理系統
新研究指出,代理使用的 JSON 式工具規格不只是中性介面,還可能壓低模型內部的拒答表徵。SafeKeep 在執行前另以攤平的文字規格判斷安全性,將有害要求平均拒答率由 23.8% 提高至 70.6%。
AI 基礎設施
Etched 的首批 N4P 推論晶片已進入機架驗證,系統以低電壓運算陣列和叢集級記憶體分別處理吞吐量與延遲瓶頸。公司宣稱稀疏 MoE 可維持逾 80% 峰值 FLOPs,但尚未公布可重現的模型、功耗與端到端效能資料。
代理訓練
Microsoft Research 團隊讓合成應用程式、任務與評分器依代理失敗軌跡共同修正,而非只持續增加靜態網頁數量。9B 模型在 14 組測試的平均成功率由 36.5% 升至 67.1%,但目前只公開四個環境作為基準。
AI 代理
阿里巴巴 Qwen 團隊公開跨手機、桌面、網頁與 DeepSearch 的 GUI 代理技術報告,以同一動作空間混合畫面操作、CLI 指令及批次動作。模型在多項自報基準領先既有系統,但權重、訓練資料與完整執行框架尚未同步釋出。
代理評測
OSReward 以 1,019 條跨 Web、Windows、Ubuntu 與行動平台的人工標註軌跡,測試視覺語言模型能否正確判斷電腦代理是否完成任務。團隊同時公開 10 萬筆推理式判決資料,並訓練可自架的 9B、35B OS-Shepherd 獎勵模型。
多模態模型
NVIDIA 開放 Cosmos 3 Edge 權重與推論流程,以 4B Mixture-of-Transformers 結合自回歸推理及擴散式多模態生成。模型可接收文字、影像與動作軌跡,並另提供以 DROID 資料調整的機器人策略版本,但物理一致性與邊緣裝置延遲仍需獨立驗證。