代理與 LLM 基礎設施
Reef 把線上推論、回饋訓練與代理版本發布接成持續學習迴圈
新開源 Reef 以相容 OpenAI、Anthropic 的推論端點收集可追溯互動,再非同步更新模型權重或代理 harness。它補上熱更新與版本回滾所需的控制面,但學習資料污染、評估器偏差及生產穩定性仍待驗證。

Human-Agent-Society 公開 Apache 2.0 授權的 Reef,試圖把通常分離的模型服務、互動紀錄、回饋、訓練、候選評測及版本發布放進同一個持續迴圈。其核心主張不是讓模型在每次請求後立即修改自己,而是令線上推論產生的軌跡成為具版本與審核關卡的學習資料,同時允許更新模型權重以及提示、記憶、技能、工具和編排規則等 harness 元件。
Reef 對外提供相容 OpenAI `/v1/chat/completions` 與 Anthropic `/v1/messages` 的端點。每次回答會附帶 `x-reef-agent-record-id`,應用程式稍後可透過 `/reef/report` 回傳分數、文字或結構化意見。系統把這些 receipt 與原始互動配對,並處理重複紀錄、工作階段合併及 off-policy staleness;不同 recipe 再決定哪些樣本合格、何時啟動更新及使用何種學習演算法。
權重路徑目前結合 SGLang 與 Slime 執行服務和分散式訓練。候選 checkpoint 或 LoRA 通過評測後,可透過 NCCL 同步至服務中的推論引擎,不必重新啟動。代理 harness 則可交由 Cordis 根據失敗軌跡提出修改。所有權重、adapter、harness tree 與路由政策都被視為 artifact,以 Git LFS 保存;各情境採用 append-only 發布鏈及 compare-and-swap 更新 head,避免較舊的訓練工作覆蓋新版。
這套抽象對需要由真實使用資料持續調整的代理很有吸引力,但「候選通過評測」並不等於安全改善。錯誤或惡意回饋可能造成資料污染,固定評估器也可能獎勵投機行為;收集完整工具軌跡還涉及憑證與個資治理。專案雖已提供 PyPI 套件、教學、測試及多種 recipe,現階段的效能與改善數字主要仍由團隊自行公布。工程團隊接下來應關注回滾、資料刪除、線上實驗隔離,以及熱更新期間的跨副本一致性。