GEMINI LABEN
ROBOTICS — 8月31日に停止した ER 1.6 preview には後継があります。Gemini Robotics ER 2 が公開プレビュー中で、通常版とストリーミング版の2種類が提供されていますVIDEO — ER 2 の成功・失敗判定は静止画ではなく生の映像フィード上で動きます。こぼれ・滑り・位置ずれのような、実行の途中で起きる失敗を捉えられる設計ですDEADLINE — 次の期限は9月30日、gemini-omni-flash-preview の廃止です。移行先は8月27日に GA になった gemini-omni-1.1-flash で、残り4週間を切りましたAPIKEY — 残りの標準 API キーは、制限付きのものも含めて9月中に全面停止します。移行先は Google Cloud サービスアカウントに紐付く auth キー形式ですPRICE — Gemini 3.7 Flash の導入価格 $0.75/$3.75 per 1M は12月31日までです。2027年1月1日から $1.50/$7.50 になるため、年を跨ぐ見積もりは2本立てが要りますAUDIO — Gemini 3.5 Transcribe は85言語以上の言語検出、話者ダイアライゼーション、単語単位タイムスタンプ、最大1,000語のカスタム語彙バイアスに対応していますROBOTICS — 8月31日に停止した ER 1.6 preview には後継があります。Gemini Robotics ER 2 が公開プレビュー中で、通常版とストリーミング版の2種類が提供されていますVIDEO — ER 2 の成功・失敗判定は静止画ではなく生の映像フィード上で動きます。こぼれ・滑り・位置ずれのような、実行の途中で起きる失敗を捉えられる設計ですDEADLINE — 次の期限は9月30日、gemini-omni-flash-preview の廃止です。移行先は8月27日に GA になった gemini-omni-1.1-flash で、残り4週間を切りましたAPIKEY — 残りの標準 API キーは、制限付きのものも含めて9月中に全面停止します。移行先は Google Cloud サービスアカウントに紐付く auth キー形式ですPRICE — Gemini 3.7 Flash の導入価格 $0.75/$3.75 per 1M は12月31日までです。2027年1月1日から $1.50/$7.50 になるため、年を跨ぐ見積もりは2本立てが要りますAUDIO — Gemini 3.5 Transcribe は85言語以上の言語検出、話者ダイアライゼーション、単語単位タイムスタンプ、最大1,000語のカスタム語彙バイアスに対応しています
記事一覧/API / SDK
API / SDK/2026-05-24上級

Apple Vision Framework × Gemini API のハイブリッド画像認識 ─ 壁紙アプリでクラウド推論コストを 7 割削減した設計メモ

iOS の Apple Vision Framework でオンデバイス事前フィルタを行い、Gemini Vision API への送信を半分以下に絞った壁紙アプリの実装記録。コスト・精度・レイテンシの実測値と、ハマりどころを共有します。

Gemini API228Vision4Apple Vision Frameworkハイブリッド推論iOS13コスト最適化26個人開発111

プレミアム記事

個人で運用している iOS 向け壁紙アプリの自動カテゴリ分類を、Gemini Vision API に全面移行したのが 2025 年の春でした。精度は十分に上がった一方で、月末のクラウド請求が想定の倍近くまで膨らみ、収益とのバランスをどう取るかが悩みになりました。アーティスト・クリエイターの廣川政樹です。2014 年から続けている個人アプリ開発のなかで、累計 5,000 万 DL を超えた頃から「全推論をクラウドに任せる」設計の限界を肌で感じる場面が増えてきました。

そこで 3 ヶ月かけて取り組んだのが、iOS 側の Apple Vision Framework で事前フィルタを行い、Gemini Vision API への送信を必要なものだけに絞るハイブリッド構成です。最終的に、月あたりの Gemini Vision API 呼び出し回数を 53%、コストを実測で約 71% 削減できました。

その設計判断と実装の細部、そして個人開発者だからこそ見えた運用上のハマりどころを、なるべく抽象化せず書き残しておきます。同じように「クラウド推論のコストと精度のバランスを取りたい」と感じている iOS 開発者の参考になれば嬉しいです。

なぜ全件クラウド推論をやめる必要があったか

最初に取り組んだのは、ユーザーが壁紙をアップロードした瞬間に、すべての画像を Gemini Vision API に送って「自然・抽象・人物・動物・乗り物・建築・宇宙」など 18 カテゴリに自動分類する仕組みでした。精度は実用域に達し、人手分類とのキャッパ係数で 0.81 を確認しています。

ただ、運用に乗せてから 1 ヶ月で 3 つの問題が浮かびました。

第一に、コストです。私の壁紙アプリには 1 日あたり平均で 18,000 枚前後の新規画像が流入し、Gemini Vision で全件処理すると、画像 1 枚あたり 0.0011 USD として月額換算で 600 USD を超えます。個人運用の AdMob 収益と組み合わせたときに、明らかに採算が取りづらくなる水準でした。

第二に、レイテンシです。海外 API への往復で 400〜1,200 ms の幅があり、ユーザーがアップロードしてから「カテゴリが反映されるまで」の体感速度が落ちていました。

第三に、明らかに分類不要な画像が一定割合を占めていたことです。具体的には、ほぼ単色の画像、ピンボケのテスト撮影画像、極端に小さなサムネイル、すでに自分のアプリで生成された壁紙のスクリーンショット ─ これらが体感で 20% 近くありました。これらに API クレジットを消費する意味はありません。

「全件をクラウドに送らない」設計に切り替える必要があると、ここで腹を決めました。

オンデバイス事前フィルタの責務をどう設計したか

Apple Vision Framework は iOS 11 から提供されているオンデバイス画像解析の基盤で、最新の iOS 26 系では VNClassifyImageRequestVNGenerateAttentionBasedSaliencyImageRequestVNDetectHumanRectanglesRequest などが Apple Neural Engine 上で動きます。レイテンシは iPhone 14 Pro 実機で 30〜90 ms、消費電力もほぼ計測誤差レベル、そして何より無料です。

ただし精度の限界もあります。Apple Vision の汎用分類器は 1,000 ラベル前後の ImageNet 系で、私の壁紙アプリが必要とする「日本画風」「和柄」「サイバーパンク」「ローファイ」のようなテイスト的なカテゴリは判別できません。ここに Gemini Vision API の意味理解の強みが効きます。

そこで、両者の責務を次のように切り分けました。

オンデバイス側は「Gemini Vision に送る意味があるかを判定するゲート役」に徹します。具体的には、

  1. 画像の鮮明さスコアと顕著性マップの面積を測り、明らかに低品質な画像を弾く
  2. 既存の自分のアプリで生成された画像か(埋め込みウォーターマーク検出)を確認する
  3. 大ジャンル(写真風・イラスト風・抽象)を Vision Framework の汎用分類で当て、後続の Gemini プロンプトに渡すヒントを作る

クラウド側(Gemini Vision API)は、上記を通過した画像に対してのみ、最終カテゴリと付加メタデータ(推奨タグ、雰囲気、推奨カラーパレット)を返す責務に集中させます。

「全部 AI でやる」のではなく、「AI に任せる仕事を選別する役割を AI に与える」設計です。両家の祖父が宮大工だった影響なのか、私はソフトウェアの設計でも「適材適所」をかなり意識する癖があり、この切り分けはしっくり来ました。

ここまでお読みいただきありがとうございます。

この記事の続きを読む

この先には、実装コードやベンチマーク結果など、実務でお役に立てる内容をご用意しています。このサイトは広告を掲載しておらず、サーバーや開発にかかる費用はメンバーの皆様のご支援で成り立っています。もしお役に立てていましたら、ご支援いただけますと大変ありがたいです。

この記事で得られること
オンデバイス事前フィルタで Gemini Vision API 呼び出しを 53% 削減した経路設計
Apple Vision の VNClassifyImageRequest と Gemini Vision の判定境界をどう引いたか
壁紙アプリ(累計 5,000 万 DL)の運用で見えた、ハイブリッド構成のハマりどころと回避策
Stripe による安全な決済 · いつでもキャンセル可能

この記事を購入する

この先の内容をすべてお読みいただけます。一度のご購入で、いつでも何度でもアクセスできます。このサイトは広告を掲載しておらず、皆さまのご支援がサーバー費用などの運営を支えています。

または
メンバーシップなら全記事が読み放題 →
シェア

お読みいただきありがとうございます

Gemini Lab は広告なしで運営しており、サーバー費用などの運営コストはメンバーシップのご支援で賄っています。実装コード・ベンチマーク・本番設計パターンなど、実務でお役立ていただける記事を毎日更新しています。もし読んでよかったと感じていただけましたら、ぜひご覧ください。

  • コピー&ペーストで使える実装コード付き
  • 毎日新しい上級ガイドを追加
  • ¥580/月 または ¥2,480 の永久アクセス
メンバーシップを見る →

関連記事

API / SDK2026-06-22
Gemini APIで商品画像を構造化分析する — 数千枚を回して固めた本番パイプライン
商品画像から自動でタグ・説明文・カテゴリを生成するツールを、単発の試作から数千枚を安定処理する本番パイプラインへ。構造化出力・再開可能なバッチ・実測コスト・モデルルーティングまで、個人開発の運用で固めた知見をまとめます。
API / SDK2026-07-16
Gemini にスクリーンショットを採点させたら、全部78〜85点だった — 絶対スコアを捨ててペア比較に切り替えるまで
Gemini Vision に App Store スクリーンショットを100点満点で採点させると、良い案も崩した案も78〜85点に潰れます。弁別能を実測して絶対スコアを捨て、位置バイアスを除いたペア比較でランキングを作るまでの実装記録です。
API / SDK2026-07-11
Gemini のコンテキストキャッシュが途中で失効する — 一時停止するパイプラインで TTL 切れを検知して張り直す
夜間バッチや再試行で処理が一時停止すると、Gemini の明示的コンテキストキャッシュは静かに TTL 切れを起こし、以降の呼び出しが全トークン課金へ戻ります。残り有効期限を握って張り直すか素通しするかを費用で決める、小さなリース設計をまとめました。
📚RECOMMENDED BOOKS
大規模言語モデル入門
山田育矢
LLM開発
生成AIプロンプトエンジニアリング入門
我妻幸長
プロンプト
Claude CodeによるAI駆動開発入門
平川知秀
AI駆動開発
※ アフィリエイトリンクを含みます
もっと見る →