GEMINI LABEN
CHAT — 明日8月26日から Google Chat が Ask Gemini のハブになります。検索・下書き・会話の追いつき・タスクとイベントの管理が、Workspace の文脈を保ったまま同じ場所に集まりますSEARCH — Google 検索の AI Mode が、場面によって Gemini 3.7 Flash で動くようになりました。検索側の応答特性が変わるため、流入の内訳を見ている方は一度確認しておきたいところですSTUDIO — Interactions API の開発者ログに対応しました。対象の呼び出しは AI Studio のダッシュボードからログを追えます。手元にログ基盤を持たない段階の切り分けが楽になりますTTS — gemini-3.1-flash-tts-preview が streamGenerateContent 経由でのストリーミング音声生成に対応しました。生成が終わるまで待たずに再生を始められますROBOTICS — gemini-robotics-er-1.6-preview は8月31日で停止します。残り6日です。後継の ER 2 系は空間推論・多段のツール連携・複数ロボットの協調に対応していますSTUDENT — 学生向けのハブ・スタディノートブック・対話的な可視化・Gemini Live での Deep Research が追加され、対象の学生は Google AI プランを1年間無料で使えますCHAT — 明日8月26日から Google Chat が Ask Gemini のハブになります。検索・下書き・会話の追いつき・タスクとイベントの管理が、Workspace の文脈を保ったまま同じ場所に集まりますSEARCH — Google 検索の AI Mode が、場面によって Gemini 3.7 Flash で動くようになりました。検索側の応答特性が変わるため、流入の内訳を見ている方は一度確認しておきたいところですSTUDIO — Interactions API の開発者ログに対応しました。対象の呼び出しは AI Studio のダッシュボードからログを追えます。手元にログ基盤を持たない段階の切り分けが楽になりますTTS — gemini-3.1-flash-tts-preview が streamGenerateContent 経由でのストリーミング音声生成に対応しました。生成が終わるまで待たずに再生を始められますROBOTICS — gemini-robotics-er-1.6-preview は8月31日で停止します。残り6日です。後継の ER 2 系は空間推論・多段のツール連携・複数ロボットの協調に対応していますSTUDENT — 学生向けのハブ・スタディノートブック・対話的な可視化・Gemini Live での Deep Research が追加され、対象の学生は Google AI プランを1年間無料で使えます
記事一覧/高度な活用
高度な活用/2026-07-12上級

待ち時間を守りながら難問だけ深く考えさせる — Gemini の thinking_level をリクエストごとに振り分ける

アプリの AI 機能を全リクエスト high で回すと待ち時間と料金が膨らみ、全部 low にすると難問で精度が落ちます。Gemini 3.x の thinking_level をリクエストの難易度で振り分け、モバイルの待ち時間予算を守りながら深い推論を必要な場面だけに回すルーターを、実測値と動くコードで設計します。

gemini109thinking-levellatency2cost4mobile5

プレミアム記事

アプリの中に小さな相談機能を足したとき、最初に届いたフィードバックは精度の話ではありませんでした。「ときどき、返ってくるまでがやけに長い」というものでした。ログを見ると、応答時間は二極化していました。ほとんどのリクエストは1〜2秒で返っているのに、一部だけが8秒、9秒とかかっていたのです。

不思議だったのは、遅いリクエストが必ずしも難しい質問ではなかったことです。「この壁紙、他に似た色のはある?」のような軽い問い合わせでも、モデルは律儀に長考していました。全リクエストを一律に深く考えさせる設定にしていたため、簡単な質問にも難問と同じだけの推論時間を払っていたわけです。

Gemini 3.x には、推論の深さをリクエストごとに指定する thinking_level があります。これを固定値で使うのではなく、リクエストの難易度に応じて出し分ける。簡単な問いは浅く速く、難しい問いだけ深く。これだけで、待ち時間の中央値を保ったまま、長考の総量をぐっと減らせました。以下では、その振り分けルーターを実測値と一緒に組み立てていきます。

「全部 high」も「全部 low」も破綻する

thinking_level を固定で運用すると、どちらに倒しても不都合が出ます。high に固定すれば、簡単な質問まで長考して待ち時間が伸び、出力トークン(思考トークンを含む)が膨らんで料金が上がります。low に固定すれば速く安く済みますが、多段の推論が要る問いで答えが浅くなり、ときに間違えます。

まず、手元で測った数字を並べます。ある機能の代表的な100リクエストを、同じプロンプト・同じ入力で thinking_level だけ変えて流し、応答時間(ストリーミングの最初のトークンではなく完了まで)と、課金対象の出力トークン量の中央値を記録したものです。モデルは gemini-flash-latest(3.5 Flash 相当)を使いました。

thinking_level応答時間 p50応答時間 p95出力トークン中央値簡単な問いの正答率難しい問いの正答率
low約1.3秒約2.1秒約21098%71%
medium約3.4秒約5.2秒約54098%86%
high約6.8秒約9.1秒約1,18099%92%

この表が語るのは、簡単な問いでは low と high の正答率がほぼ変わらない一方、応答時間は約5倍、出力トークンは約5.6倍に開くということです。つまり簡単な問いを high で処理するのは、待ち時間と料金を丸ごと無駄に払っている状態です。逆に難しい問いを low で処理すると、正答率が71%まで落ちます。10問に3問近く外す機能を、課金メンバーに出すわけにはいきません。

答えは「どちらか一方に固定しない」ことです。問いの難しさを見分けて、簡単なものは low、難しいものだけ high に回す。中間は medium で受ける。振り分けの精度さえ確保できれば、待ち時間の中央値は low のまま、難問の正答率は high に近づけられます。

リクエストを難易度で見分ける

振り分けの心臓は、リクエストが届いた瞬間に「これはどのくらい深く考える必要があるか」を安く見積もる部分です。ここに重い判定を置くと本末転倒なので、二段構えにします。まず費用ゼロのヒューリスティックで大半を仕分け、判断がつかないものだけモデルに一枚噛ませます。

ヒューリスティックは、入力の性質から難易度の当たりをつけます。私が個人開発の機能で使っている観点は、次の三つに集約できました。

  1. 入力の長さと構造:文字数が短く、単一の事実照会に見えるものは low 寄り。複数の条件が絡む、あるいは「比較して」「理由も」といった多段の要求は high 寄りです。
  2. 要求される出力の型:一語・一値で答えられる問いは low。手順・根拠・トレードオフの説明を求める問いは深い推論が要ります。
  3. 失敗したときの痛み:課金導線に関わる案内や、ユーザーの操作を左右する提案は、多少遅くても medium 以上に倒します。速さより外さないことを優先する領域です。

これらは完全ではありません。短いのに難しい問い(「AとBはどちらが得?」は10文字でも多段推論です)は必ず取りこぼします。だからこそ、ヒューリスティックで白黒つかないグレーゾーンだけを、次の段でモデルに委ねます。

ここまでお読みいただきありがとうございます。

この記事の続きを読む

この先には、実装コードやベンチマーク結果など、実務でお役に立てる内容をご用意しています。このサイトは広告を掲載しておらず、サーバーや開発にかかる費用はメンバーの皆様のご支援で成り立っています。もしお役に立てていましたら、ご支援いただけますと大変ありがたいです。

この記事で得られること
リクエストの難易度を軽量な事前判定で見分け、thinking_level を low / medium / high に振り分けて p95 レイテンシを予算内に収める設計
深く考えさせるほど遅く高くなる — thinking_level ごとの応答時間と出力トークンを手元で実測した比較表と、待ち時間予算からの逆算
難問を low で処理して精度が落ちる誤ルーティングを、事前判定に Flash を一枚噛ませて取りこぼす二段構えの落とし穴と対処
Stripe による安全な決済 · いつでもキャンセル可能

この記事を購入する

この先の内容をすべてお読みいただけます。一度のご購入で、いつでも何度でもアクセスできます。このサイトは広告を掲載しておらず、皆さまのご支援がサーバー費用などの運営を支えています。

または
メンバーシップなら全記事が読み放題 →
シェア

お読みいただきありがとうございます

Gemini Lab は広告なしで運営しており、サーバー費用などの運営コストはメンバーシップのご支援で賄っています。実装コード・ベンチマーク・本番設計パターンなど、実務でお役立ていただける記事を毎日更新しています。もし読んでよかったと感じていただけましたら、ぜひご覧ください。

  • コピー&ペーストで使える実装コード付き
  • 毎日新しい上級ガイドを追加
  • ¥580/月 または ¥2,480 の永久アクセス
メンバーシップを見る →

関連記事

高度な活用2026-08-25
AI 検索が広げたクエリを分母から外して、実質 CTR を出し直します
運営サイトの検索データで、表示回数上位5件のクリックが全て0でした。うち4件は人間が打つ語ではありません。分母を作り直す手順と、Gemini に判定を任せる境界の引き方をまとめます。
高度な活用2026-08-24
日本の版画か中国の版画かを Gemini に当てさせない来歴ゲート
浮世絵の壁紙アプリに素材を入れる前の来歴チェックを、モデルに国を当てさせる形から、紙に写っている痕跡だけを列挙させる形へ組み替えた記録です。判断の表をこちら側に置き、証拠が足りない入力は保留へ回す配線を、動くコードと運用の判断基準まで含めてまとめました。
高度な活用2026-07-11
Gemini の Function Calling に危険度別の承認ゲートを挟む実装
自律エージェントに全権を渡すのは怖い。Gemini の Function Calling ループで、危険度に応じてツール呼び出しを自動実行と承認待ちに振り分け、承認後に結果をモデルへ返す承認ゲートを実装します。
📚RECOMMENDED BOOKS
大規模言語モデル入門
山田育矢
LLM開発
生成AIプロンプトエンジニアリング入門
我妻幸長
プロンプト
Claude CodeによるAI駆動開発入門
平川知秀
AI駆動開発
※ アフィリエイトリンクを含みます
もっと見る →