本地推論/開源執行期
llama.cpp 0.3.0 加入混合注意力 KV cache、MTP 與 DeepSeek 4 張量切分
llama.cpp 0.3.0 原生支援 dots3-note 的 DSA/滑動視窗混合注意力,並為 GLM-4.5-Air 接入多 token 預測。DeepSeek 4 現可使用張量切分橫跨多張 GPU,但發布說明沒有提供吞吐量、延遲或顯存比較。
Archive
共 953 篇技術新聞
本地推論/開源執行期
llama.cpp 0.3.0 原生支援 dots3-note 的 DSA/滑動視窗混合注意力,並為 GLM-4.5-Air 接入多 token 預測。DeepSeek 4 現可使用張量切分橫跨多張 GPU,但發布說明沒有提供吞吐量、延遲或顯存比較。
AI 程式開發/代理評測
DeepRepoQA 不再讓程式代理沿單一路徑搜尋,而是以 MCTS 比較多條程式庫探索分支,再從具行號的證據合成答案。官方在 SWE-QA 報告 4 至 7 個百分點增益,但資料污染、推論成本與有限的跨語言測試仍待驗證。
模型發布與推論架構
阿里巴巴開放 Qwen3.8-Flash-Next 權重,以 Gated DeltaNet 壓縮大部分歷史狀態,再由 Qwen Sparse Attention 檢索完整上下文。模型原生支援 262K token,但官方的百萬 token 效能與代理評測仍有待獨立重現。
檢索與 RAG 工具
Sentence Transformers 為 `MultiVectorEncoder` 補上完整訓練流程,讓 ColBERT 式模型可直接以配對資料進行領域調整。醫療檢索實驗顯示預監督檢查點更容易適應新領域,但結論只來自單一資料與有限模型家族。
AI 安全
安全研究員以 Keystork 冒充相機應用程式,要求 Android StrongBox 為任意 AI 影像產生有效 Content Credentials。攻擊不必匯出私鑰,暴露的弱點是簽署端受入侵後仍能濫用真金鑰,而非 C2PA 簽章演算法遭破解。
模型發布
Thomson-1.0-Small 從 Qwen3.6-35B-A3B 延伸,以專有文件、合成改寫及通用能力重播資料進行中期訓練。官方評測顯示法律代理能力有所提升,但部分通用與程式任務反而落後基礎模型。
IBM 的兩款英語語音辨識模型把輸出速率降至每秒12.5個token,並以三段時間下採樣減少運算。官方在單張H200測得每秒處理逾3.5小時音訊,但這是大批次吞吐量,不等同互動串流延遲。
Multiverse Computing 改由原始 120B 模型直接蒸餾經結構壓縮及量化的 60B 學生模型,避免把中間恢復模型的誤差當成學習上限。結果顯示 4-bit 模型可超越同架構 BF16 檢查點,但未全面追回原始教師的能力。
AI 代理與私隱
Anthropic 讓聊天與執行工作任務的 Cowork 共用同一組可編輯記憶,並改為在對話進行期間更新。敏感主題預設不寫入,但一般消費方案預設啟用記憶,而且使用者不能只阻止其中一個介面讀取。
AI 推論基礎設施
Dynamo 的實驗性 Shadow Engine Failover 讓兩個推論程序映射同一份 GPU 權重,避免程序崩潰後重新載入模型。NVIDIA 的 GLM-5.2 測試顯示恢復時間縮短近 39 倍,但目前主要支援 vLLM,亦無法處理 GPU、節點或跨節點故障。
多模態檢索
WeMM-Embedding 以同一向量空間處理文字、圖像、影片、視覺文件及交錯輸入,並提供 2B、4B、9B 三種尺寸。官方成績領先多個公開基線,但模型不支援音訊,部分產品效果也只能由騰訊內部 A/B 測試佐證。
訓練資料
LAION-BVD 從 Common Crawl 整理 13 億條影片網址,並下載約 8,000 萬段、合計一千萬小時的內容。資料管線與網址清單已公開,但主要媒體子集受存取限制,且合規責任仍由研究者承擔。