視覺模型/自監督學習
LeVJEPA 移除目標編碼器與預測器,影片預訓練算力最多降至 V-JEPA 2 的二十分之一
LeVJEPA 以單一編碼器、跨視圖不變性損失及 SIGReg 防止表徵坍塌,不再依賴 EMA 目標網路、stop-gradient 或像素解碼器。作者在相同資料與訓練週期下報告 5.6 至 20.8 倍算力差距,但結果仍限於團隊重訓的凍結編碼器基準。
Archive
共 947 篇技術新聞
視覺模型/自監督學習
LeVJEPA 以單一編碼器、跨視圖不變性損失及 SIGReg 防止表徵坍塌,不再依賴 EMA 目標網路、stop-gradient 或像素解碼器。作者在相同資料與訓練週期下報告 5.6 至 20.8 倍算力差距,但結果仍限於團隊重訓的凍結編碼器基準。
推論系統
FreeToken 不再以固定規則卸載 MoE 專家,而是按實測記憶體及 PCIe 頻寬,在 CPU 執行與 GPU 快取之間動態分工。作者報告 RTX 5090 可用每秒 22 至 25 token 執行 284B 模型,但測試仍由開發團隊完成,且完整權重依然需要大量主記憶體。
AI 晶片與資料中心
Meta 的 MTIA 300 將 1.2TB/s 網路 I/O 與十六個訊息引擎直接整合進加速器,讓 collective 不再佔用主要計算陣列。官方在 150B 推薦模型上報告通訊時間較對照 GPU 叢集縮短 3.9 倍,但尚未提供足以比較整體訓練成本的完整系統資料。
AI 評測與安全研究
Anthropic 的自動對齊研究代理可自行查文獻、設計資料及後訓練模型,在十類安全問題上關閉 26% 至 96% 的評測差距。結果亦優於受限的人類提案基線,但比較給代理更長迭代時間,且只能證明可量測失敗的修補能力。
AI 安全
Pandex 發現企業的 AI 導向文件含有數百個指向未註冊套件或網域的安裝指令,Claude、Codex、Hermes 隨後在真實企業環境執行研究人員設置的信標。問題不在 llms.txt 格式本身,而是代理把可信文件直接升格為可執行命令,繞過套件所有權與來源驗證。
代理評測
Stanford 主導的開放基準把資料分析、模擬、定理證明及儀器校準等科研工作封裝成可重跑的終端任務。Claude Opus 5 配合 Claude Code 居首,但三次試跑後的解題率仍只有 30%,顯示一般 coding benchmark 高分不能直接外推至科學工作。
AI 評測與安全
Google DeepMind、MLCommons 等機構把 Gemini 2.5 Flash Lite 與未公開安全題庫送入同一個可驗證安全飛地,雙方只能取得受限結果。這套設計降低基準污染風險,但信任仍落在硬體根金鑰、可信運算基礎與跨機構程式碼審查上。
AI 開發工具
OpenAI 因 Cursor 被 SpaceX 收購而啟動合約終止程序,並表示不再向 Cursor 提供未來模型。Cursor 目前的路由、企業白名單與自備 API key 文件尚未說明終止後的確切行為,工程團隊不宜把模型替換視為無痛切換。
文件 AI/推論最佳化
愛丁堡大學研究顯示,低解析度表格雖不適合直接讀數,仍足以供 VLM 判斷相關性。訓練-free 的兩段式流程在長文件測試中節省 41% decoder token,準確率比全表原解析度單次推理高 7.1 個百分點。
AI 評測/資料科學代理
DeepChart 以 1,482 個實例分別評測資料擷取、數值推導及圖表渲染,揭露外觀評分掩蓋的數據幻覺。超長 10-K 輸入令平均來源資料 F1 由 0.385 降至 0.167,顯示擴大上下文視窗不足以取代證據定位。
AI 基礎設施/資料中心
AWS 已取得首套 Vera CPU 伺服器及 Vera Rubin GPU,兩家公司並計畫於 2027至2028年部署額外200萬顆 NVIDIA GPU。合作同時把 NVLink Fusion、NVHBM、Nitro 與 EFA 納入異質機架設計,但多數容量與效能仍屬未來承諾。
AI 軟體/文件處理
Parse 5 將 PDF、簡報與影像轉成保留表格及閱讀順序的 Markdown,API 定價為每千頁 1.50 美元。官方公布的 ParseBench 79.2 分只涵蓋五個評測維度中的三個,不能當成完整文件理解成績。