世界模型與生成影片
ReWorld 以姿態索引地標庫固定 KV 預算,讓互動世界模型走遠後仍能返回原景
ReWorld 把短期動作控制與長期場景記憶分配給不同注意力範圍,再以固定容量的地標庫保存歷史。作者展示 704×1280 即時串流及 64 秒返回軌跡,但目前只有論文和示範頁,尚未發布權重或程式碼。
Archive
共 957 篇技術新聞
世界模型與生成影片
ReWorld 把短期動作控制與長期場景記憶分配給不同注意力範圍,再以固定容量的地標庫保存歷史。作者展示 704×1280 即時串流及 64 秒返回軌跡,但目前只有論文和示範頁,尚未發布權重或程式碼。
AI 代理與開源工具
Prime Agent 以常駐 IPython、daemon 工作階段及可版本化的 Continual Harness 支援長時間程式代理。作者報告 ARC-AGI-3 RHAE Best@1 從 30% 升至 95.5%,但成績反映整套模型與 harness,不能當作底層模型能力的單獨比較。
代理評測
新基準以私有科學測試檢查單位、數值不變量、檔案語義與跨模組資料流,而不只判斷程式能否編譯。Claude Code 搭配 Opus 5 的整體 pass@1 為 47.90%,實驗也顯示加入領域知識有時反而令代理錨定錯誤方向。
推論與開源執行環境
DFlash 2 以候選路徑選擇器及動態卷積改善區塊擴散草稿,在單請求測試中讓 Qwen3.8-27B 達到自回歸解碼的 2.7 至 3.4 倍吞吐量。最新可重現問題顯示 vLLM nightly 會建立錯誤的 decoder layer,並在共用詞表權重前暫時多配置近 4.74GiB,24GB 顯示卡可能無法啟動。
AI 晶片與資料中心
Meta 公開 MTIA 300 的系統設計,以內建 NIC chiplet、近記憶體歸約單元及編譯式 HCCL 加速推薦模型訓練。官方稱 40 顆加速器上的通訊時間較對照 GPU 叢集縮短至約四分之一,但未提供成本、功耗或通用 LLM 訓練比較。
AI 基礎設施
新版 AMI 內建 `pcluster-diag`,可按節點角色檢查 Slurm、IMDS、目錄服務與 Lustre 狀態並輸出結構化報告。升級也終止 Amazon Linux 2 與 AWS Batch 支援,另有權限、網路出口和執行環境變更需要預先處理。
AI 開發工具
DeepSeek Harness 主套件的 `latest` 已指向 0.1.1-rc.2,但多個底層套件仍把早期版本標成最新。直接安裝外掛 API 可能報出 peer dependency 衝突,甚至無聲建立版本錯配的依賴樹。
AI 基礎設施
AWS 將 Ray 叢集建立、遠端提交、監控及工作空間連線整合進 HyperPod on EKS。介面沿用 KubeRay 與標準 Ray API,但部署仍需多個附加元件,官方亦未公布成本或效能比較。
AI 研究
η-learning 以極值統計約束生成模型,從缺少罕見事件的配對資料合成高解析度極端情境。方法可供基礎設施壓力測試,但不能預測災害何時發生,也仍依賴可信的外部統計。
AI 開發工具
新功能讓執行中的代理讀取 PR 評論並按 `steer` 指示修正工作,同時要求明確的讀取權限。官方周報卻建議從較早建立的 v0.87.4 試用;固定該標籤的部署實際上拿不到功能。
AI 基礎設施
Groq 3 LPX 將 256 顆 LP30、128GB SRAM 與編譯器預排的晶片間傳輸整合成低延遲解碼系統。第三方測試顯示長上下文速度領先現有公開端點,但成本、併發吞吐與生產服務表現仍未公開。
AI 評測與開發工具
Rails Foundation 公開用於 Agents on Rails 榜單的 Ruby 評測框架 lemans,支援 Daytona 與本機 Docker 沙盒。框架會隔離驗證程式、保存可重播證據,並在評分前還原受保護檔案。