推論系統
llama.cpp b10456 修正 SYCL 量化轉碼排程,Arc 70 的 Q4_0→FP32 吞吐提高至 158.19 GB/s
新版依量化區塊大小配置執行緒與工作群組,避免 SYCL copy kernel 過度或不足訂閱。Arc 70 微基準吞吐由 20.21 升至 158.19 GB/s,但這不是完整模型的 token 生成加速比。
Archive
共 966 篇技術新聞
推論系統
新版依量化區塊大小配置執行緒與工作群組,避免 SYCL copy kernel 過度或不足訂閱。Arc 70 微基準吞吐由 20.21 升至 158.19 GB/s,但這不是完整模型的 token 生成加速比。
模型架構/推論
Intern-S2-Mobius 把傳統 Transformer 各層綁定的知識儲存與注意力推理拆開,讓多個 Reasoner 反覆查詢同一組全域 Memory。開放權重可由 LMDeploy、vLLM 或 Transformers 載入,但近 4 倍加速仍是官方特定評測結果。
生成式影像工具
社群為影片模型 MiniMax H3 訓練 5.21GB 單幀 VAE,讓 reference-to-video 管線只生成一幀即可執行換裝、改姿勢與視角變換。方法展示影片模型可被重用為影像編輯器,但目前依賴非官方權重、特定工作流及尚未完全落地的 ComfyUI 單幀介面。
開放模型
Qwen 開放 Qwen3.8-27B 權重,以 64 層 Gated DeltaNet/Gated Attention 混合架構壓低長上下文成本,並提供原生視覺理解與可調推理深度。官方代理評測升幅顯著,但部分資料集、修正版題目及執行框架由 Qwen 自行設定,不能直接視為跨供應商的公平排名。
AI 評測與開發工具
英國 AI Security Institute 開源 optstop,按題目與任務層級的後驗不確定性決定何時停止重複評測。九組影子測試平均省下 81.1% 試驗,但效果依評分型態、題目排序及交換性假設而變。
推論系統
FreeBalance 用上一層殘差狀態預測下一層專家負載,讓權重交換與注意力計算重疊。方法不改變最終路由與模型輸出,但目前證據只涵蓋兩款 MoE 模型、單一八卡拓撲及 prefill 工作負載。
代理系統/評測
TWIN 要求代理先把未知環境寫成可執行 Python 世界模型,重播歷史完全一致後才允許採取真實動作。相同基礎模型在 ARC-AGI-3 的分數由直接操作時的 7.8,提升至 93.3。
AI 安全與標準
Anthropic 說明支援的新 Claude 模型會在文字生成過程嵌入不可見訊號,產生的檔案則可加入簽章式來源資料。官方同時警告,短文、改寫與翻譯會削弱偵測,找不到訊號也不能排除內容曾由 Claude 生成。
AI 基礎設施
Groq 已於 8 月 16 日在 Free 與 Developer 方案停用兩款 Llama 端點,舊模型 ID 現會回傳錯誤。官方建議改用 GPT-OSS 或 Qwen,但跨模型家族遷移意味工具呼叫、結構化輸出與提示行為都須重新驗證。
AI API/推論成本
DeepSeek 已為 V4 Flash 與 Pro 啟用分時費率,尖峰時段價格是離峰兩倍。受衝擊最大的不是一般輸入,而是長對話與程式代理大量使用的快取命中 token。
雲端 AI/模型生命週期
Oracle 為 Grok 3、Grok 4 與多款 Fast、Mini、Code 端點設定的 8 月 15 日退休日已到。這不是模型別名的透明切換;OCI 使用者必須修改模型 ID,並重新驗證推理參數、影像限制與區域可用性。
本機推論
新版修補兩個位於模型前處理層的相容性缺口:WebP 影像會先轉碼,Qwen renderer 亦不再要求 system 訊息必須排在最前。變更雖不涉及新模型或 kernel,卻可避免多模態及代理對話在進入推論核心前失敗。