推論コスト
(すいろんこすと/Inference Cost)
- 起点・背景(海外)
- 2023年
- 更新
- 2026-09-24
一言でいうと
学習済みのモデルに入力を渡して出力を得るたびに発生する、計算資源と費用のことです。
開発元と登場年
推論コストは特定の開発元を持つ語ではありません。大規模言語モデルの文脈では、2023年12月にSardanaらが論文「Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws」を公開し、学習の費用だけでなく推論の費用まで含めてモデルの大きさを決めるべきだと示しました。同論文は、推論の需要が大きい場合には、より小さなモデルを長く学習させるほうが全体の費用を抑えられると述べています。
何を解決するために生まれたか
学習にかかる費用はモデルを作る段階で発生しますが、推論の費用は利用のたびに積み上がります。生成AIを業務に組み込むと、1回あたりの費用は小さくても、呼び出しの回数と扱う文書の量に比例して総額が増えます。この語は、運用の段階で継続的に発生する費用を学習の費用と区別し、見積もりと削減の対象として扱うために使われます。
APIで提供されるモデルでは、料金が入力トークンと出力トークンに分けて設定され、出力の単価のほうが高く設定されることが一般的です。例として、Anthropicが公開しているClaudeの料金表(2026年9月時点)では、主要なモデルで出力トークンの単価が入力トークンの5倍であり、応答を長く書かせるほど費用が増えます。同じ料金表は、繰り返し渡す指示文や文書をキャッシュから読み出す場合は標準で入力単価の1割になること、急がない処理をまとめて送るBatch APIでは入出力とも半額になることを示しています。
どこで使われているか
生成AIを組み込んだ機能の予算策定と、モデルの選定の場面で使われます。問い合わせ対応、文書の要約、スカウト文面の生成のように呼び出しの回数が多い用途では、1件あたりの推論コストに件数を掛けた額が毎月の費用になります。
開発の現場では、単純な処理を小型のモデルに振り分ける、キャッシュを使う、応答の長さに上限を設けるといった手段で費用を管理します。LLMOpsの監視項目にも、応答時間と並んで推論コストが入ります。
人材市場の実情
推論コストを主担当とする職種名で募集されることは一般的でなく、AIエンジニア、機械学習エンジニア、MLOpsエンジニアが業務の一部として担当します。職務経歴書では、この語そのものよりも「API費用の削減」「モデルの切り替え」「キャッシュの導入」といった具体的な作業として書かれることが一般的です。
試作だけを経験した候補者は費用を意識する場面が少なく、本番運用で請求額を管理した経験のある人材は限られます。
混同されやすい技術との違い
| 用語 | 指すもの | 推論コストとの違い |
|---|---|---|
| 学習コスト | モデルを学習させるための計算資源と費用 | モデルを作る段階で発生する。推論コストは利用のたびに発生する |
| トークン | モデルが文章を扱う単位 | 料金を数える単位。推論コストはその単位で計算された費用 |
| レイテンシ | 応答が返るまでの時間 | 時間の指標。費用とは別に監視する |
| トークンマネジメント | モデルに渡す情報量を設計する取り組み | 推論コストを抑える手段のひとつ |
採用担当の見極めポイント
- 本番で動いている機能について、毎月の費用をどう把握し、どの手段で抑えたかを聞いてください。試作止まりの経験では、この質問に具体的に答えられないことが多くなります
- 費用を下げた結果、出力の品質がどう変化したかを確認してください。品質の測定と組み合わせて判断した候補者は、evalsの仕組みも扱えている可能性が高くなります
- 求人票に書く場合は、利用しているモデルの提供元と、月あたりの呼び出し規模の目安を示してください。候補者は自分の経験した規模と比べて応募を判断できます