AI 研究
共有推論のコスト研究がH100での検証結果を公開、計測方法でテナントの負担割合が変化
unallocはクラスターとモデルの請求データを統合する。研究では、計測方法によって同じテナントの費用負担割合に約12–14パーセントポイントの差が生じた。実機検証は各ワークロードにつき短時間のテストを1回実施しただけで、結果を正しい配賦割合についての確定的な結論とみなすことはできない。

独立研究者のTimothy Uristaは9月21日、マルチテナント推論サービスでGPUとモデルAPIの支出をどう配賦するかを検討した研究論文を投稿した。論文ではオープンソースツールのunallocを用い、Kubernetesのリソース費用、モデルゲートウェイのログ、プロバイダーの請求データを単一の台帳に統合する。主な発見は、帳簿上の合計額が正しくても、計測ルールやラベルの扱いによってコストの配賦結果が大きく変わるという点だ。[論文概要](https://arxiv.org/abs/2609.24991)
このツールは、OpenCostやLiteLLMなどのデータソースを共通の`CostRow`に変換し、金額を10進数値で扱うとともに、システムごとに異なるチーム、プロジェクト、コストセンターのフィールドを正規化する。レポートでは帰属先を特定できない金額に加え、フォールバック用のフィールドに基づいて配賦した支出も個別に表示する。これにより、「何らかの名称が見つかった」だけで担当チームを特定できたと誤認するのを防ぐ。[公開リポジトリ](https://github.com/timurista/unalloc)
研究の実機検証ではH100 80GBを1枚使用し、vLLM 0.29.0上でQwen2.5-7B-InstructをBF16で実行した。プレフィックスキャッシュを有効にし、合成したマルチテナントトラフィックを再生した。4種類のワークロードをそれぞれ2分間実行したところ、トークン数で配賦した場合、検索型テナントは総費用の16.5%–18.9%を占めた。一方、50ミリ秒ごとに未完了のリクエスト間で時間を均等配分すると、その割合は4.7%–5.3%となり、約12–14パーセントポイントの差が生じた。[実験方法と結果](https://arxiv.org/pdf/2609.24991)
こうした違いはコストの定義に関わる。OpenCostが今年7月に公開した技術文書では、すでに2つの算定基準を区別している。割り当てコストには、モデルを常時利用可能にするための予約済みリソースと共用インフラが含まれる。使用コストは実際の推論による消費のみを計上し、キャッシュヒットも考慮する。両者の差は、低レイテンシーの維持に必要なアイドル容量に由来する可能性があり、トークン単価だけではデプロイの効率を判断できない。[OpenCostのコストモデル](https://opencost.io/blog/opencost-llmd-inference-cost/)
台帳の統合にも別の落とし穴がある。リポジトリでは、ゲートウェイとプロバイダーの支出データを同時に取り込むと、同じモデル呼び出しを二重計上する可能性があるため、データソースを明確に選ぶ必要があると注意を促している。このツールは、請求書との照合、金額順に並べたラベル欠落の一覧、継続的インテグレーション(CI)に組み込める未帰属割合のしきい値を提供する。これらの仕組みにより、配賦ルールを検証可能なエンジニアリングプロセスに落とし込める。[ツールの使い方とデータ経路](https://github.com/timurista/unalloc)
どちらの配賦アルゴリズムもコストの唯一の正解ではなく、時間の均等配分自体も近似的なルールだ。実機で得られた証拠は、単一モデル、GPU 1枚、各ワークロードにつき1回の短時間テストに限られ、複数回の再実行に基づく不確実性の推定はない。このため、エンジニアリングチームは自らの環境のプロンプト長、キャッシュヒット状況、複数ターンのトラフィックを用いて再検証したうえで、社内の配賦方針を決める必要がある。[論文の限界と再現方法](https://arxiv.org/pdf/2609.24991)