模型與開發者平台
Qwen3.8-Max-0902 強化長週期程式代理,但榜首差距仍在統計誤差內
阿里雲更新 Qwen3.8-Max 的託管快照,主攻工程級程式開發、多工具協作及視覺理解,並保留百萬 token 上下文。Code Arena 暫列第一,但樣本較少且排名區間重疊,尚不足以證明穩定超越其他旗艦模型。
Archive
共 941 篇技術新聞
模型與開發者平台
阿里雲更新 Qwen3.8-Max 的託管快照,主攻工程級程式開發、多工具協作及視覺理解,並保留百萬 token 上下文。Code Arena 暫列第一,但樣本較少且排名區間重疊,尚不足以證明穩定超越其他旗艦模型。
時間序列基礎模型
Google Research 的 3.3 億參數 TimesFM-3 可在單次前向傳遞中聯合預測多條時間序列,並納入歷史及已知未來協變量。程式碼採 Apache 2.0,但新版權重另受非商業授權約束,生產部署不能沿用舊版假設。
生成式介面/世界模型
Runway 的 Solaris 把點擊、拖曳與文字輸入直接當成影片模型的條件訊號,即時合成下一個 720p 介面畫面。這項研究預覽展示不用 HTML/CSS 描述互動的可能性,但尚未公開延遲、成本、權重或可重現評測。
模型評測研究
Ai2 開源 BenchMIRT,從逾 3.4 萬道題目的模型作答模式中分離安全與一般推理等潛在能力。實驗顯示部分安全基準主要反映推理表現,精選一成題目亦能大致保留能力排序,但資料只涵蓋截至 2025 年初的模型。
多模態模型與開發者平台
Google 為三款 Gemini Flash 模型加入 agentic video processing,模型可按需載入畫面、音訊或逐字稿,而非預先以固定幀率處理整段影片。官方宣稱最多節省 88% token、降低 66% 成本,但短片的首 token 延遲及評測可重現性仍待檢驗。
AI 程式開發工具
新版在所有內建 Seatbelt profile 中阻擋 Docker、OrbStack、Colima 等容器執行期的 socket、程式與 IPC 介面。更新也修正寫入政策、安全檢查器與 A2A 取消狀態,但自訂安裝路徑及既有工作流程仍需另行驗證。
模型安全
Astra 在 OpenAI 測試中完成瀏覽器沙箱逃逸、root 提權鏈並發現兩個零日漏洞。公司據此首次確認模型達到 Critical 網安門檻,進階能力將採分級開放。
推論與執行期
llama.cpp 修正 Qwen3.8-Flash-Next 在草稿 token 被拒絕時無法正確回滾 SSM 與卷積狀態的問題。單張 RTX PRO 6000 測試顯示程式碼解碼由 123 增至 183 token/s,但結果仍侷限於特定量化、草稿頭與單一工作槽。
推論與執行期系統
LMDeploy 0.17.0 為 TurboMind 加入 DeepEPv2 專家平行後端,並讓 KV connector 接上 Mooncake Store。新版亦支援 Kimi K2.6、非二次冪頁面與結構化回應,但未提供跨硬體的端到端效能數據。
模型與開發者平台
Anthropic 推出具 100 萬 token 上下文的 Claude Fable 5.1,將快取讀取價格降低 75%,並加入逐訊息推理力度與工具間進度更新。既有 Fable 5 工作流程不能直接換模型,強制工具使用、思考區塊重用及安全路由都需要重新測試。
Vector databases and AI data infrastructure
LanceDB 0.38.0 把物化視圖、可計算欄位與函式資源需求帶進 Python、Node.js 等介面,讓嵌入與資料轉換更靠近儲存層。版本同時更改表格判定、分支操作及執行環境需求,RAG 系統升級前需要交叉驗證查詢結果。
AI coding tools
OpenAI 為個別 MCP 工具加入輸出 token 上限,並允許 app-server 的 shell 指令執行超過一小時。新版也修補壓縮歷史後遺失使用者指令與授權的問題,但內建規劃工具改為預設停用。