AI 代理與自動研究
VALG 以型別化證明圖追蹤定理改寫,9 個 COLT 開放子題僅 2 組維持原始範圍
VALG 把機器學習理論研究拆成問題形式化、證明依賴圖、局部推導與多角度審查,並按失敗層級決定修補或另開放寬分支。系統在 9 個 COLT 2026 開放子題產生 22 個內部定稿候選,但只有 2 次執行得到符合原始問題範圍的結果。
Archive
共 968 篇技術新聞
AI 代理與自動研究
VALG 把機器學習理論研究拆成問題形式化、證明依賴圖、局部推導與多角度審查,並按失敗層級決定修補或另開放寬分支。系統在 9 個 COLT 2026 開放子題產生 22 個內部定稿候選,但只有 2 次執行得到符合原始問題範圍的結果。
AI 程式開發與形式驗證
CAPRI 將「證明可被 Isabelle 接受」與「模型只修改獲授權區域」拆成兩項獨立判定。180 次修補實驗中,144 個可建置候選有 6 個改動受保護文字,限制模型只回傳證明本體後則未再出現違約。
模型訓練與評估
研究團隊從 FineWeb‑Edu 篩出 880 億 token 的 K–5 語料,並從零訓練 0.6B、1.3B 與 5B 模型及同算力對照組。實驗顯示擴大模型、SFT+GRPO 和上下文示例主要喚起已有能力,未明顯突破預訓練知識邊界。
AI 安全與預訓練
Synthetic Persona Pretraining 把依據「價值憲章」生成的第一人稱反思寫入約 10% 預訓練文件,再以後訓練把該人格綁定至助理身份。新公開的完整實驗、權重與資料顯示,提早介入主要改善價值泛化,抵抗一般 jailbreak 則未必需要從零開始。
LLM 推論系統
Reduced Matrix Multiplication 不改權重,而是按當前 activation 的欄範數,只計算矩陣乘法中分數最高的共享維度。A100 測試顯示收益隨序列增長,但短上下文的選擇與 kernel 啟動成本幾乎抵消節省。
世界模型與評測
PlayWorld 用可觀察畫面的代理動態修正控制指令,避免不同世界模型的移動幅度令固定軌跡失去可比性。171 個場景顯示,現有模型雖能生成流暢畫面,卻仍難以保存全域空間與視野外持續演變的狀態。
AI 基礎設施
OpScale 不再複製整個模型,而是按流量與序列長度,只擴充當下成為瓶頸的 attention、MLP 等算子。作者在 A100 與 GB200 叢集重播 92.9 萬個請求,最高以少 36.3% GPU 達到相同延遲目標,但原型程式尚未公開。
模型評測
TsuGO 用 600 道可驗證圍棋死活題,量度模型是否把推理資源投向正確分支,而不只計算答案與 token 數。移除四選一候選後,多款推理模型的準確率與搜尋效率同步急跌,與神經網路引導的 KataGo 仍有明顯距離。
模型訓練
一項 Qwen3-8B 蒸餾實驗發現,完整深度共同訓練時兩種正規化位置幾乎沒有差別,但逐階段加入 Transformer block 後,Post-Norm 明顯勝出。結果顯示正規化位置不能脫離模型成長策略單獨選擇。
AI 程式工程
Linux 7.2-rc7 在發布週期後段仍由逾 230 名貢獻者送入超過 400 項修正,部分問題源自 AI 審查工具。AI 並未取代核心維護流程,但 Sashiko 等代理已把找錯速度推到人工分流與驗證能力之前。
多模態與遙測
LongEarth-Bench 將 117,000 張遙測影像整理成約 120,000 組長序列問答,要求模型追蹤地貌演變、異常與缺失狀態。以 Qwen2.5-VL-7B 為底的 LongEarth-R1 加入幀編號、結構化推理及時空獎勵,但資料、權重與程式尚未公開。
AI 代理與開發工具
AutoDesign 以外層代理分析執行軌跡、修改生產系統,再由獨立開發集決定是否接納更新。開源 DesignHarness 在作者的 PosterBench 超越多個商用系統,但自動分數與人類偏好的相關係數只有 0.34。