ホームへ戻る

模型與企業部署

Flower Endeavor 1.0、企業向けプライベートデプロイに対応するも、モデル仕様と独立評価は依然不在

Flower Labsは、推論、ソフトウェア開発、長時間のエージェントタスク向けにEndeavor 1.0を発表した。マネージドサービスとして利用できるほか、顧客環境へのデプロイにも対応する。初期スコアは一部のフロンティアモデルに迫るが、現時点では限定プレビューとベンダーによる自己評価しかなく、実際のデプロイコストや能力はまだ検証できない。

Jayaraniarunachalam · CC BY-SA 3.0 · Image source
zh-Hant

Flower Labsは9月1日、推論、ソフトウェア開発、長時間のツール利用をサポートする汎用モデルとしてEndeavor 1.0を発表した。提供形態は重みの一般公開ダウンロードではなく、Flowerが運営するマネージドサービス、またはライセンスと技術サポートの下で企業自身のインフラストラクチャにデプロイする方式となる。プレビュー期間中は、少数の組織からの申請のみを受け付ける。

この構成の技術的な要点は、同一モデルをクラウド環境とプライベート環境の双方で利用できることにある。企業はまずAPI経由で導入し、その後、モデル周辺のエージェント、評価、ツールインターフェース、データパイプラインを書き直すことなく、機密性の高いワークロードを社内クラスターへ移行できる。Flowerによると、Endeavorは推論時に推論の深さ、コンテキスト、ツール選択、失敗後の検査と再試行を管理し、複数のcoding harnessおよびagent harnessを用いてポストトレーニングと評価を行っている。

公式発表では、GPQAが92.0、HumanEvalが98.2、IFEvalが94.1、AIME 2026が99.9とされている。同社の比較表によれば、EndeavorはHumanEvalでGPT-5.6 Sol、Claude Fable 5、Kimi K3、Nemotron 3 Ultraを上回り、AIMEでは上位2モデルと同じ99.9を記録した。一方、GPQAとIFEvalでは依然としてGPT-5.6 Solを下回っている。また、ほぼ満点に達しているAIMEでは、モデル間の差を効果的に判別することがすでに難しい。これらの数値はいずれもFlowerが算出したものであり、テストプロンプト、サンプリング回数、推論予算、harnessの設定はまだ完全には公開されていない。

Flowerはまた、モデル開発にFlowerBenchの企業内タスクから得られたシグナルを使用したとしている。データとツールは参加組織の環境内に保持され、サニタイズ済みの結果だけが返送される。ただし、発表資料にはEndeavorのFlowerBenchスコア、失敗パターン、再現可能なプロトコルは記載されていない。

現時点で、エンジニアリングチームは「プライベートデプロイ可能」をオープンウェイトと同一視すべきではない。Flowerは、パラメータ数、アーキテクチャ、コンテキスト長、重みの形式、ライセンス上の制約、推奨ハードウェア、メモリ使用量、スループット、価格をまだ開示していない。今後は、正式なモデルカード、推論サーバーとの互換性、独立機関による長時間タスク評価に加え、マネージド版とプライベート版でモデル、ツールのセマンティクス、アップデート頻度が同一かどうかを注視する必要がある。

出典

  1. Introducing Endeavor 1.0 from Flower Labs
  2. Flower Labs launches Endeavor 1.0 for private frontier AI deployments