GEMINI LABEN
ROBOTICS — 8月31日に停止した ER 1.6 preview には後継があります。Gemini Robotics ER 2 が公開プレビュー中で、通常版とストリーミング版の2種類が提供されていますVIDEO — ER 2 の成功・失敗判定は静止画ではなく生の映像フィード上で動きます。こぼれ・滑り・位置ずれのような、実行の途中で起きる失敗を捉えられる設計ですDEADLINE — 次の期限は9月30日、gemini-omni-flash-preview の廃止です。移行先は8月27日に GA になった gemini-omni-1.1-flash で、残り4週間を切りましたAPIKEY — 残りの標準 API キーは、制限付きのものも含めて9月中に全面停止します。移行先は Google Cloud サービスアカウントに紐付く auth キー形式ですPRICE — Gemini 3.7 Flash の導入価格 $0.75/$3.75 per 1M は12月31日までです。2027年1月1日から $1.50/$7.50 になるため、年を跨ぐ見積もりは2本立てが要りますAUDIO — Gemini 3.5 Transcribe は85言語以上の言語検出、話者ダイアライゼーション、単語単位タイムスタンプ、最大1,000語のカスタム語彙バイアスに対応していますROBOTICS — 8月31日に停止した ER 1.6 preview には後継があります。Gemini Robotics ER 2 が公開プレビュー中で、通常版とストリーミング版の2種類が提供されていますVIDEO — ER 2 の成功・失敗判定は静止画ではなく生の映像フィード上で動きます。こぼれ・滑り・位置ずれのような、実行の途中で起きる失敗を捉えられる設計ですDEADLINE — 次の期限は9月30日、gemini-omni-flash-preview の廃止です。移行先は8月27日に GA になった gemini-omni-1.1-flash で、残り4週間を切りましたAPIKEY — 残りの標準 API キーは、制限付きのものも含めて9月中に全面停止します。移行先は Google Cloud サービスアカウントに紐付く auth キー形式ですPRICE — Gemini 3.7 Flash の導入価格 $0.75/$3.75 per 1M は12月31日までです。2027年1月1日から $1.50/$7.50 になるため、年を跨ぐ見積もりは2本立てが要りますAUDIO — Gemini 3.5 Transcribe は85言語以上の言語検出、話者ダイアライゼーション、単語単位タイムスタンプ、最大1,000語のカスタム語彙バイアスに対応しています
記事一覧/API / SDK
API / SDK/2026-03-24上級

Gemini API コンテキストキャッシュ — 大量ドキュメント処理のコストを90%削減する方法

Gemini API のコンテキストキャッシュで、大量ドキュメントの反復処理コストを最大90%削減する方法を解説します。仕組みの理解、Python SDK での作成手順、具体的なコスト計算、キャッシュが本当に得になる境界線まで、個人開発の実体験を交えて整理しました。

Gemini API228コンテキストキャッシュ3コスト最適化26Python44プレミアム4大規模処理

プレミアム記事

取り組みの背景:なぜコンテキストキャッシュが重要なのか

Gemini API を本番環境で利用する際、最大のコスト要因は繰り返し送信される大量のコンテキストです。たとえば、500ページの技術マニュアルについて100件の質問に答える場合、毎回マニュアル全体をプロンプトに含めると、トークン消費量は膨大になります。

Gemini API のコンテキストキャッシュ(Context Caching)機能を使えば、一度キャッシュした大規模コンテキストを複数のリクエストで再利用でき、入力トークンコストを最大90%削減できます。

この記事で学べること:

  • コンテキストキャッシュの仕組みと料金体系
  • Python SDK を使ったキャッシュの作成・利用・管理
  • 大量ドキュメント処理のコスト最適化戦略
  • 本番環境でのキャッシュ設計パターン

コンテキストキャッシュの仕組み

基本アーキテクチャ

コンテキストキャッシュは、大規模なコンテキスト(ドキュメント、システムプロンプト、コード等)を Google のサーバー側に一時保存し、その後のリクエストでキャッシュIDを参照するだけで同じコンテキストを利用できる仕組みです。

通常のリクエストフロー:

リクエスト1: [500ページのマニュアル] + 質問1 → 回答1
リクエスト2: [500ページのマニュアル] + 質問2 → 回答2
リクエスト3: [500ページのマニュアル] + 質問3 → 回答3
→ マニュアル部分のトークンが毎回課金される

キャッシュ利用時のフロー:

キャッシュ作成: [500ページのマニュアル] → キャッシュID
リクエスト1: [キャッシュID] + 質問1 → 回答1(キャッシュ部分は割引料金)
リクエスト2: [キャッシュID] + 質問2 → 回答2(キャッシュ部分は割引料金)
リクエスト3: [キャッシュID] + 質問3 → 回答3(キャッシュ部分は割引料金)

料金体系

コンテキストキャッシュの料金は、通常の入力トークンに比べて約75%割引です(2026年3月時点)。

項目通常入力キャッシュ入力削減率
Gemini 2.5 Pro$1.25/MTok$0.3125/MTok75%
Gemini 2.5 Flash$0.075/MTok$0.01875/MTok75%

※ MTok = 100万トークン。キャッシュの保存料金($4.50/MTok/時間 for Pro)が別途発生。

ここまでお読みいただきありがとうございます。

この記事の続きを読む

この先には、実装コードやベンチマーク結果など、実務でお役に立てる内容をご用意しています。このサイトは広告を掲載しておらず、サーバーや開発にかかる費用はメンバーの皆様のご支援で成り立っています。もしお役に立てていましたら、ご支援いただけますと大変ありがたいです。

この記事で得られること
Context Cachingを活用したGemini API呼び出しコストの最適化
大規模テキスト処理における費用削減パターン
キャッシング戦略のベストプラクティス
Stripe による安全な決済 · いつでもキャンセル可能

この記事を購入する

この先の内容をすべてお読みいただけます。一度のご購入で、いつでも何度でもアクセスできます。このサイトは広告を掲載しておらず、皆さまのご支援がサーバー費用などの運営を支えています。

または
メンバーシップなら全記事が読み放題 →
シェア

お読みいただきありがとうございます

Gemini Lab は広告なしで運営しており、サーバー費用などの運営コストはメンバーシップのご支援で賄っています。実装コード・ベンチマーク・本番設計パターンなど、実務でお役立ていただける記事を毎日更新しています。もし読んでよかったと感じていただけましたら、ぜひご覧ください。

  • コピー&ペーストで使える実装コード付き
  • 毎日新しい上級ガイドを追加
  • ¥580/月 または ¥2,480 の永久アクセス
メンバーシップを見る →

関連記事

API / SDK2026-07-11
Gemini のコンテキストキャッシュが途中で失効する — 一時停止するパイプラインで TTL 切れを検知して張り直す
夜間バッチや再試行で処理が一時停止すると、Gemini の明示的コンテキストキャッシュは静かに TTL 切れを起こし、以降の呼び出しが全トークン課金へ戻ります。残り有効期限を握って張り直すか素通しするかを費用で決める、小さなリース設計をまとめました。
API / SDK2026-08-27
Gemini に渡す前に表が壊れる場所は結合セルと2行ヘッダ
スプレッドシートの表をそのまま Gemini に渡すと、結合セルと2行ヘッダで行の所属が失われます。抽出時点で何が消えるかを実測し、平坦化と集計行の検出までを Python で組みます。
API / SDK2026-08-23
Gemini TTS を streamGenerateContent で受け取り、先頭のチャンクから鳴らす
Gemini の TTS をストリーミングで受け取ると、音声は「ファイル」ではなく PCM の断片で届きます。チャンクごとに WAV ヘッダを付けた場合に何が起きるかを手元で測り、連結とヘッダの正しい順序を実装まで示します。
📚RECOMMENDED BOOKS
大規模言語モデル入門
山田育矢
LLM開発
生成AIプロンプトエンジニアリング入門
我妻幸長
プロンプト
Claude CodeによるAI駆動開発入門
平川知秀
AI駆動開発
※ アフィリエイトリンクを含みます
もっと見る →