最新模型
Cloudflare、選択肢の確率を単一のフォワードパスで出力する意思決定モデル「Clef」をオープンソース化
ClefとClef-flashは、エージェントの分類とルーティングを、指定された選択肢への直接スコアリングに置き換え、Apache 2.0ライセンスでモデルの重みを公開する。公式テストではレイテンシ面の利点が示されたが、タスク精度と確率のキャリブレーションは、デプロイ先のデータで検証する必要がある。

Cloudflareは10月1日、ClefとClef-flashを発表し、Workers AIでのホストとモデルの公開を開始した。今回の技術的なポイントは、エージェントがあらかじめ定義された回答候補の中から判断できるようにすることだ。たとえば、カスタマーサポートのメッセージをどのチームに割り当てるべきか、すぐに対応する必要があるかを判定し、プログラムが選択肢ごとの確率に応じて後続の処理を実行する。公式発表
2つのモデルは、それぞれQwen3.8-27BとQwen3.5-9Bをベースにしている。Clefのモデルカードによると、新たに追加された共同構造型の意思決定ヘッドがベースモデルの最終層の隠れ状態を読み取り、入力された根拠を各質問に振り分け、すべての有効な選択肢のスコアを同時に計算する。各質問ではさらにsoftmaxを適用して確率を得る。この処理は単一のフォワードパスで完了し、回答をトークン単位で生成してテキストを解析する必要がない。Clefモデルカード
公開インターフェースは、状況を記述するstateと質問の集合questionsを受け付ける。名前付き選択肢、順序の評価、真偽判定に対応し、画像や動画を追加することもできる。Clef-flashに付属するsystemone関数は、Jev/SystemOneリクエスト形式を受け付け、回答、信頼度、確率を返す。これにより、既存の意思決定フローを置き換えるための具体的な手段が提供される。公開ファイルにはモデルの重み、意思決定ヘッド、エンコーディング用コードが含まれ、ライセンスはApache 2.0だ。Clef-flashモデルカード
性能はタスクごとに評価する必要がある。Cloudflare社内のDecision Indexテストで示されたリクエスト遅延の中央値は、Clefが209.3ミリ秒、Flashが38.8ミリ秒だった。一方、FlashのCLINC150+OOSにおけるmacro-F1は66.8%で、Clefの97.4%を下回った。これらは提供元によるテスト結果であり、中国語の分類、異なるハードウェア、本番サービスでも同じ効果が得られるとは限らない。テスト結果
エンジニアリングチームは、ツール選択やチケットの振り分けなど、回答候補が明確な処理から評価するとよい。デプロイ時には、モデルカードにあるカスタム意思決定ヘッドの例を参考に検証し、中国語のデータ、未知のクラス、誤判定のコストを測定する必要がある。また、出力確率をキャリブレーションし、人間に引き継ぐしきい値を設定することも重要だ。出力形式を制限しても、判断の正しさが保証されるわけではない。