ホームへ戻る

代理與 LLM 基礎設施

Reef、オンライン推論・フィードバック学習・エージェントのバージョン公開を継続学習ループに統合

新たにオープンソース化されたReefは、OpenAIおよびAnthropic互換の推論エンドポイントを通じて追跡可能なインタラクションを収集し、モデルの重みまたはエージェントharnessを非同期で更新する。ホットアップデートとバージョンロールバックに必要なコントロールプレーンを補完する一方、学習データの汚染、評価器のバイアス、本番環境での安定性は今後の検証を要する。

Wonker from London, United Kingdom · CC BY 2.0 · Image source
zh-Hant

Human-Agent-Societyは、Apache 2.0ライセンスのReefを公開した。通常は分離されているモデルサービング、インタラクションの記録、フィードバック、学習、候補の評価、バージョン公開を、単一の継続的なループに統合することを目指している。その中核となる考え方は、リクエストのたびにモデルが即座に自己改変することではない。オンライン推論で生成された軌跡を、バージョン管理と審査ゲートを備えた学習データへ変換すると同時に、モデルの重みだけでなく、プロンプト、メモリ、スキル、ツール、オーケストレーション規則などのharnessコンポーネントも更新できるようにすることだ。

Reefは、OpenAIの`/v1/chat/completions`およびAnthropicの`/v1/messages`と互換性のあるエンドポイントを外部向けに提供する。各レスポンスには`x-reef-agent-record-id`が付与され、アプリケーションは後から`/reef/report`を介して、スコア、テキスト、または構造化されたフィードバックを返せる。システムはこれらのreceiptを元のインタラクションと照合し、重複レコード、セッションのマージ、off-policy stalenessを処理する。そのうえで、recipeごとに、どのサンプルを適格とするか、いつ更新を開始するか、どの学習アルゴリズムを使用するかを決定する。

重みの更新経路では現在、SGLangとSlimeを組み合わせてサービングと分散学習を実行する。候補checkpointまたはLoRAが評価を通過すると、再起動することなく、NCCL経由でサービング中の推論エンジンへ同期できる。エージェントharnessについては、Cordisが失敗軌跡に基づいて変更案を提示できる。すべての重み、adapter、harness tree、ルーティングポリシーはartifactとして扱われ、Git LFSに保存される。各シナリオではappend-onlyのリリースチェーンとcompare-and-swapによるhead更新を採用し、古い学習ジョブが新しいバージョンを上書きするのを防ぐ。

この抽象化は、実際の利用データに基づいて継続的に調整する必要があるエージェントにとって魅力的だ。しかし、「候補が評価を通過した」ことは、安全性が向上したことを意味しない。誤った、あるいは悪意のあるフィードバックはデータ汚染を引き起こす可能性があり、固定された評価器が投機的な挙動に報酬を与えるおそれもある。また、完全なツール軌跡の収集には、認証情報と個人データのガバナンスという問題が伴う。プロジェクトはすでにPyPIパッケージ、チュートリアル、テスト、複数のrecipeを提供しているものの、現時点での性能および改善に関する数値は、依然として主に開発チーム自身が公表したものだ。今後、エンジニアリングチームは、ロールバック、データ削除、オンライン実験の分離、ホットアップデート中のレプリカ間整合性に注目すべきだ。

出典

  1. Your Inference Server is Secretly a Learner: Reef Infrastructure for Continual Self-Improving Agents
  2. Human-Agent-Society/reef
  3. Reef documentation