本機 AI/推論系統
Magnitude 依記憶體頻寬與容量挑選本機模型,為程式代理自動配置量化與推測解碼
新開源推論伺服器 Magnitude 會實測硬體,再推薦模型、量化、上下文長度與預估速度的完整組合。它把本機代理最容易配錯的記憶體與併發參數自動化,但效能與模型品質目前仍主要依賴專案方的目錄及測試。
Archive
共 939 篇技術新聞
本機 AI/推論系統
新開源推論伺服器 Magnitude 會實測硬體,再推薦模型、量化、上下文長度與預估速度的完整組合。它把本機代理最容易配錯的記憶體與併發參數自動化,但效能與模型品質目前仍主要依賴專案方的目錄及測試。
AI 平台與基礎設施
NVIDIA 已同意收購 Hugging Face,取得模型、資料集、應用程式與推論服務的重要分發樞紐。公司承諾平台不會綁定 NVIDIA 硬體,但交易後的實際治理、排序與跨硬體最佳化仍須持續檢驗。
模型與代理安全
OpenAI 將 Astra 開放至 API、AWS 與付費 ChatGPT,並在 Codex 實驗以筆記加歷史搜尋跨越上下文視窗。模型的代理與資安能力顯著提高,但思考鏈更容易規避監控,部署端也可能中止合法工作。
多模態與世界模型
Puffin-World 以九通道 Omni-Camera 條件統一絕對物理方向與相對鏡頭運動,並在同一架構中完成理解、生成及三維重建。程式、權重與 Puffin-16M 資料已公開,但物理狀態目前主要限於靜態場景的重力和緯度。
AI 開發工具
Hugging Face 開源 Funes,把 Claude Code、Codex、pi 與 Hermes 的逐輪紀錄寫入同一個 Lance 資料集。檢索與重排序預設在本機執行,但跨機同步、密鑰殘留及外部記憶的提示注入仍需自行治理。
多模態檢索
Hcompany 開源 2.6 億與 8 億參數的 NeoMME,讓文字 token 和原始影像 patch 共用同一個編碼器,不再附掛視覺塔或因果解碼器。其檢索版本同時輸出 dense 與 late-interaction 表徵,但效率與準確率數字目前主要來自作者評測。
語音 AI
Microsoft 新語音辨識模型涵蓋 60 種語言,原生提供說話者分離、術語偏置、語碼轉換及逐字時間戳。獨立 API 測試顯示其錯字率與批次吞吐量俱佳,但限時價格、中文分項品質及串流延遲仍待驗證。
應用研究
Google 的 WeatherNext 3 不再只依賴延遲的數值天氣再分析資料,而以全球衛星觀測持續更新預報。新模型提高降雨與局地變化解析度,但仍仰賴國家氣象資料,尚非完全端到端的直接資料同化。
推論基礎設施
PAIR 在 Ollama、LM Studio 與代理程式之間加入相容代理層,依模型位置及 GPU 負載把獨立請求派往區域網路內的電腦。它增加的是工作負載並行度,不會合併顯示記憶體,也不能把單次推論拆到多張 GPU。
AI 程式開發與安全
Copilot Business 與 Enterprise 管理員設定的排除規則,現在可阻止 Copilot App 和 CLI 直接把指定檔案加入模型上下文。這項機制不是完整資料防漏或執行沙箱;官方仍列出符號連結、遠端檔案系統及 IDE 間接語意等缺口。
推論系統
HeadWiseKV 不再讓所有注意力頭保存相同歷史,而是離線校準每個 head 的多級視窗並真正縮減實體 KV residency。論文在固定模型測試中把最大成功上下文由 114K 延至 161K,但公開程式庫的更高數字來自特定量化與單張 4090D。
開放模型
IFM 釋出從 0.9B 到 375B-A23B 的六種文字模型,連同資料配方、中間檢查點、訓練程式與代理後訓練紀錄。最大模型的 TerminalBench 成績經劫持稽核後由 70.2% 降至 66.9%,凸顯可重現發布也必須處理基準污染。