返回首頁

模型與企業部署

Flower Endeavor 1.0 開放企業私有部署,但模型規格與獨立評測仍缺席

Flower Labs 推出面向推理、程式開發及長時間代理任務的 Endeavor 1.0,可使用託管服務或部署於客戶環境。首批成績接近部分前沿模型,但目前只有限量預覽及供應商自評,尚不能驗證實際部署成本與能力。

Jayaraniarunachalam · CC BY-SA 3.0 · Image source
zh-Hant

Flower Labs 於 9 月 1 日發布 Endeavor 1.0,定位為可支援推理、程式開發及長時間工具使用的通用模型。交付方式不是公開下載權重,而是由 Flower 經營的託管服務,或在授權及技術支援下部署至企業自己的基礎設施;預覽期只接受少數組織申請。

這種安排的技術重點是讓同一模型跨越雲端與私有環境。企業可以先經 API 接入,再把敏感工作負載遷入內部叢集,而毋須重寫模型周邊的代理、評測、工具介面及資料管線。Flower 表示 Endeavor 會在推論時管理推理深度、上下文、工具選擇以及失敗後的檢查與重試,並以多種 coding、agent harness 進行後訓練和評測。

官方公布 GPQA 92.0、HumanEval 98.2、IFEval 94.1 及 AIME 2026 99.9。依其比較表,Endeavor 在 HumanEval 領先 GPT-5.6 Sol、Claude Fable 5、Kimi K3 與 Nemotron 3 Ultra;AIME 則與前兩者同為 99.9。然而 GPQA 與 IFEval 仍落後 GPT-5.6 Sol,而接近滿分的 AIME 已難有效區分模型。這些數字均由 Flower 產生,測試提示、取樣次數、推理預算及 harness 設定尚未完整公開。

Flower 也稱模型開發使用 FlowerBench 的企業內部任務訊號:資料與工具留在參與組織環境,只回傳清理後結果。不過發布資料沒有列出 Endeavor 的 FlowerBench 分數、失敗類型或可重現協定。

工程團隊目前不宜把「可私有部署」等同開放權重。Flower 尚未披露參數量、架構、上下文長度、權重格式、授權限制、建議硬體、記憶體占用、吞吐量與價格。下一步應觀察正式模型卡、推論伺服器相容性、獨立長任務評測,以及託管與私有版本是否具有相同模型、工具語義和更新節奏。

來源

  1. Introducing Endeavor 1.0 from Flower Labs
  2. Flower Labs launches Endeavor 1.0 for private frontier AI deployments