返回首頁

開放模型

Ornith-1.5 將自產任務納入強化學習,397B 模型自報 Terminal-Bench 2.1 達 86.1 分

Ornith 釋出 9B、35B MoE 與 397B MoE 三種開放權重模型,訓練迴圈同時最佳化任務、代理鷹架與解題軌跡。397B 的程式代理成績接近閉源前沿模型,但數字尚未經獨立重現,模型發布文件亦存在授權缺口。

Adalbert Seitz · Public domain · Image source
zh-Hant

Ornith 公布 Ornith-1.5 系列,規模涵蓋 9B 稠密模型、每個 token 啟用約 3B 參數的 35B MoE,以及 397B MoE。與只最佳化代理鷹架及解題軌跡的 Ornith-1.0 相比,新版把「產生下一批訓練任務」也納入強化學習:模型先依既有解題歷史提出較難問題,再建立包含工具、分解策略及驗證器的任務專屬鷹架,最後生成解答軌跡。

任務回報由有效性、前沿難度與新穎性三項相乘。有效性檢查環境能否執行及驗證正誤;難度函數偏好成功率接近 0.2 的題目;新穎性則抑制反覆產生近似題。這種乘法設計可讓任何一項失敗的任務取得零或極低回報,但實際效果仍取決於驗證器能否識別規格漏洞及 reward hacking。

官方自報 397B 模型在 Terminal-Bench 2.1、SWE-bench Verified 與 DeepSWE 分別取得 86.1、86.0、56.0;各項結果平均五次執行,部分測試停用網路並移除 Git 歷史。模型提供 256K context,BF16 權重約 800GB,建議以八張 H200 作張量平行部署,也備有 FP8、INT4、GGUF 與 MLX 版本。

工程團隊不應直接把榜單視為可部署品質。這些分數主要由發布者自行測得,部分評測使用 Claude 作裁判,尚缺完整訓練資料、成本及獨立重現報告。第三方檢查還發現模型卡雖標示 MIT,所指向的 LICENSE 檔案截至 8 月 21 日仍為 404;在授權文字補齊前,企業不宜只憑平台標籤決定再散布或商用。

來源

  1. Ornith-1.5: From Self-Scaffolding to Self-Improvement
  2. Ornith-1.5-397B Model Card
  3. Ornith-1.5-397B: licence declared, the file still missing for the third time in three days