ホームへ戻る

AI 推論與開發者工具

Jev、テキスト生成を捨て、並列サンプリングで型付き確率的意思決定を出力

TypeSafe AIのJevは、事前定義されたブール値、選択肢、スコアのみを生成し、モデル推論をプログラムへ直接組み込める低レイテンシーの分岐へ変えようとしている。ただし、型が正しいことは判断が正しいことを意味せず、公式がうたう速度とコストの優位性も、自社製ワークフローと非公開モデルに基づいている。

Dietmar Rabich · CC BY-SA 4.0 · Image source
zh-Hant

TypeSafe AIはJevの早期アクセスを開始し、このモデルを文字列の続きを生成するチャットモデルではなく、「確率付きの関数呼び出し」と位置付けている。開発者はまず、ブール値、有限個の選択肢、連続スコアなどの出力空間を定義し、その後、テキストと構造化されたプログラム状態をモデルへ送信する。Jevは全回答とその信頼度および確率を一度に並列生成し、token単位の自己回帰デコーディングは行わない。このインターフェースは、分類、ルーティング、ランキング、ポリシー判断、リアルタイム制御といった高頻度ワークフローを対象としており、周辺プログラムがルールの組み合わせと副作用の実行を担う。

同社によると、JevはReinforcement Learning for Calibrated Decisions(RLCD)で訓練されており、予測確率が実際の正答率により近くなるという。公開価格は入力100万token当たり0.042米ドルで、出力には別途料金がかからない。公式測定によるエンドツーエンドのレイテンシーは約70~500ミリ秒で、自社製ワークフローでは最先端LLMより最大193.6倍高速かつ444.6倍低コストだとしている。技術的に妥当な優位性は、出力空間の縮小と並列サンプリングに由来する。アプリケーションが「承認/拒否」または有限個のカテゴリしか必要としない場合、フィールド名、JSON、説明文の生成は確かに余分なコストとなる。

しかし現時点では、Jevを汎用LLMの代替と見なすには証拠が不足している。公式評価では、GPT‑6 AstraとClaude Fable 5.1が出した確率の平均を参照回答として使用しているうえ、ワークフローも同社の能力チームが設計しており、人間によるground truthと独立したテストセットを備えた標準ベンチマークではない。アーキテクチャ、パラメータ数、weights、学習データも公開されていない。コミュニティでは特に「hallucinationを起こさない」という主張に疑問が呈されている。モデルは出力がschemaに準拠することを保証できても、誤った選択肢に高い信頼度を与えたり、out-of-distribution入力に対して、形式上は有効でも状況に適さない回答を選ぶよう強制されたりする可能性がある。エンジニアリングチームは次の段階として、calibration error、回答拒否メカニズム、data driftに加え、複数の局所的な確率をプログラムで組み合わせた後も信頼性が維持されるかを実測すべきだ。また、同一タスクで小規模分類器およびconstrained decoding LLMと比較する必要がある。

出典

  1. Introducing System One Models & Jev
  2. Introducing System One Models and Jev — community discussion
  3. System One adapter for LLM APIs