影片生成與模型架構
V-RAE 改用凍結視覺表徵作影片 latent,K600 生成訓練最快提早六倍收斂
V-RAE 不再只為像素重建訓練影片 VAE,而是在 DINOv3、SigLIP2 或 V-JEPA 2.1 等語意特徵上加入時間壓縮與解碼器。作者測得新 latent 可同時改善生成與未來畫面預測,但目前只展示低解析度、短片段及類別條件生成。
Archive
共 968 篇技術新聞
影片生成與模型架構
V-RAE 不再只為像素重建訓練影片 VAE,而是在 DINOv3、SigLIP2 或 V-JEPA 2.1 等語意特徵上加入時間壓縮與解碼器。作者測得新 latent 可同時改善生成與未來畫面預測,但目前只展示低解析度、短片段及類別條件生成。
AI 安全
RAGSieve 不需要可信語料庫或預先標註的毒化樣本,而是分別比較查詢排名尾端與文件的局部語意鄰域。開源實驗涵蓋三個問答集、三款檢索器及六種攻擊,但單篇流暢毒文與已污染的檢索尾端仍可能繞過偵測。
開放模型
丹麥 Foundation Models 團隊從零訓練 Mimir v1,利用 HRM 的高、低層循環,在作者測試的 20 項基準上逼近部分 4B 模型。權重已公開,但「可允許資料」不等於完全開放資料,部分語料只依協議或歐盟研究例外使用。
模型可解釋性與評測
一項重測發現,改寫探針的情境包裝,就能把模型規模相關係數由 +0.94 移至 −0.82。研究建議至少跨九至十組提示詞量度,否則單一 activation direction 不足以比較模型。
代理記憶與檢索
ReFind 保留未改寫的對話紀錄,讓代理反覆使用關鍵字、時間及 session 篩選蒐集證據。在約 2,800 題測試中,它以 58.2% 平均準確率超過最強結構化記憶基線的 53.2%,但比較並未統一所有控制器與工具預算。
推論系統
DARTree 把擴散草稿模型的因果校正由單一路徑延伸至多分支,並把逐節點 heap 搜尋改成按深度批次展開。單張 RTX 6000 Ada 測試中,七項任務的平均加速均勝過 DFlash、DDTree 與 Domino,但程式尚未公開。
模型發布
新技術報告把科學 PDF、時間序列、工具操作及長時代理任務納入同一訓練管線,並公開 Apache 2.0 權重。獨立的 Memory Decoder 可在凍結 397B 主幹下加入領域能力,但目前只以生物學模組示範。
LLM 推論系統
TEMPO 不再只平衡 token 或啟用專家數,而是同時估算 HBM 權重載入與 GEMM tile padding。SGLang 原型在部分 Qwen3‑235B 流量提高 4%至6%吞吐,但對通訊受限的 DeepSeek‑V3 反而只留下額外成本。
AI 程式代理與評測
Vero 要求代理同時實作多模組程式並提交機器可驗證的正確性證明,而非只通過單元測試。四組前沿代理中,最佳設定仍有 16 個儲存庫未能完整解決,10 個更令所有設定失敗。
AI 科研代理
OmniScientist 讓代理直接檢視影像、訊號、影音、3D 結構及軌跡,再完成構思、實驗與論文寫作。36 個案例全部產生完整稿件,但案例數、程式公開狀態與自動評審設計仍有待釐清。
代理系統
StateBridge 用正交 Procrustes 轉換,把發送代理的末層隱藏狀態映射至接收代理的輸入嵌入空間,毋須訓練投影器。四款模型的平均成績比最強基線高 2.4 至 2.9 點,但目前只支援使用相同模型權重的代理。
推論系統/實體 AI
FlashDrive 同時處理視覺編碼、LLM prefill、推理 token 與軌跡去噪四個瓶頸,在 RTX PRO 6000 上把 Alpamayo 1.5‑10B 單窗口延遲由 717 降至 151 毫秒。開源實作接近即時推論,但仍經過專門微調,閉環測試規模亦只有 100 段模擬片段。