AI・開発トレンド

コンテキストウィンドウ

こんてきすとうぃんどう/Context Window

登場(海外)
2020
国内で見られるように
2023年ごろ
更新
2026-08-24

一言でいうと

モデルが一度に扱えるトークン数の上限で、ここに収まらない情報はモデルに届きません。入力側の上限と、1回の応答で出せる出力の上限は別に設定されているのが通例です。

開発元と登場年

初期の大規模モデルでは数千トークン程度が上限で、長い文書は分割して渡す必要がありました。2020年代に入って上限は段階的に広がり、現在の主要なモデルでは長大な文書をそのまま渡せる水準になっています。

ただし上限が広がっても、制約がなくなったわけではありません。入力が長くなるほど費用と応答時間が増え、渡した情報のどこを重視するかもモデル任せになります。国内で「入るから全部渡す」設計が行き詰まる事例が出始めたのは2023年以降です。

何を解決するために生まれたか

これは解決策ではなく制約です。モデルの構造上、一度に扱える範囲には限りがあり、その値がコンテキストウィンドウとして示されます。

この制約があるために、必要な情報だけを選んで渡す工夫が生まれました。RAG(検索して関連部分だけを渡す方式)は、その代表的な対処法です。

どこで使われているか

設計の判断に直接かかわります。社内文書を扱う仕組みでは、全文を渡すか、検索して一部だけ渡すかをここで決めます。長い会話を続ける仕組みでは、過去のやり取りをどこまで保持するかの方針が必要になります。

会話が長くなると古い部分が押し出される、という挙動の説明にもこの概念が使われます。

人材市場の実情

募集の軸にはならない語です。ただし、面接で長文の扱いをどう設計したかを聞くと、生成AIの実務経験の深さが見えます。

上限に収まるかどうかだけを見て設計する人と、費用・応答時間・精度の3点で判断する人では、運用に入ってからの差が出ます。

混同されやすい技術との違い

用語指すものコンテキストウィンドウとの違い
トークン文章を扱う最小単位数える単位のほう。コンテキストウィンドウはその上限
メモリ過去のやり取りを保持する仕組み実装側の工夫。上限そのものは変わらない
RAG検索して関連部分だけを渡す方式上限に収めるための手段の一つ
パラメータ数モデル内部の重みの数モデルの規模。扱える入力量とは別の指標

採用担当の見極めポイント

  • 長い文書を扱う機能の経験があるかを確認してください。上限を超えたときにどう設計を変えたかが、実務経験の分かれ目になります
  • 「上限が広いモデルを使えば解決する」と答える候補者には、費用と応答時間をどう見たかを重ねて聞いてください
  • 出力が途中で切れたときにどう対処したかを聞いてください。入力の上限と出力の上限が別だと理解しているかが分かります
  • 会話の履歴をどこまで保持する設計にしたかを聞くと、利用者の体験まで考えているかが見えます

関連キーワード

トークン / RAG / 推論コスト / 長文処理 / メモリ / LLM

出典