GEMINI LABEN
SUNSET — 画像生成モデルの停止まで残り6日です。imagen-4.0 系と Gemini 3 Image 系が8月17日に止まりますMIGRATE — 移行先として gemini-3.1-flash-image が案内されています。generate_images から generate_content への書き換えが必要ですCHECK — 移行後に同じプロンプトで同じ絵が出る保証はありません。必要な生成物は停止前に確保しておく判断が要りますCLASSROOM — 8月17日は Gemini in Classroom のモバイル提供が始まる日でもあります。web は8月10日に全年齢の学生へ広がりましたDEPRECATION — Grok 4.1 ファミリーの停止は8月20日、gemini-robotics-er-1.6-preview は8月31日で、後継は er-2 系ですCHANGELOG — Gemini API の changelog は7月30日が最新のままです。直近の大きな変更は Gemini 3.6 Flash と 3.5 Flash-Lite の GA ですSUNSET — 画像生成モデルの停止まで残り6日です。imagen-4.0 系と Gemini 3 Image 系が8月17日に止まりますMIGRATE — 移行先として gemini-3.1-flash-image が案内されています。generate_images から generate_content への書き換えが必要ですCHECK — 移行後に同じプロンプトで同じ絵が出る保証はありません。必要な生成物は停止前に確保しておく判断が要りますCLASSROOM — 8月17日は Gemini in Classroom のモバイル提供が始まる日でもあります。web は8月10日に全年齢の学生へ広がりましたDEPRECATION — Grok 4.1 ファミリーの停止は8月20日、gemini-robotics-er-1.6-preview は8月31日で、後継は er-2 系ですCHANGELOG — Gemini API の changelog は7月30日が最新のままです。直近の大きな変更は Gemini 3.6 Flash と 3.5 Flash-Lite の GA です
TAG

multimodal

25 記事
タグ一覧に戻る
関連タグ:
gemini-api18python8gemini7production5video4streaming4advanced3file-api3vision3image3audio3troubleshooting2
Gemini API/2026-07-07上級

Omni Flash で短尺動画から SNS 告知メタデータを1パス抽出する

公開プレビューの Gemini Omni Flash に短尺動画を1回渡すだけで、告知文・チャプター・見せ場タイムスタンプを構造化 JSON で受け取る実装をまとめます。フレーム抽出を挟む多コール構成との違い、fps と media_resolution の効かせどころ、1本あたりのコスト試算まで、個人開発の告知作業を回す視点で扱います。

Gemini API/2026-06-23上級

Nano Banana 2 に動画を渡してサムネイルを1枚生成する — gemini-3.1-flash-image の動画→画像を実装したメモ

GA になった gemini-3.1-flash-image(Nano Banana 2)に動画ファイルを文脈として渡し、サムネイルを1枚生成する実装手順です。フレーム抽出との違い、preview からの移行差分、1枚あたりのコストと所要時間の実測までまとめました。

Gemini 応用/2026-06-16上級

ユーザー投稿のメディアを Gemini に渡す前段を固める — 安全弁としての検証パイプライン実装メモ

ユーザーがアップロードした画像や動画をそのまま Gemini に流すと、MIME 偽装・EXIF 漏洩・展開爆弾・動画の処理待ちといった落とし穴に次々はまります。先頭バイト判定から Files API の状態ポーリング、後始末までを動くコードで段階的に組み立てます。

Gemini API/2026-05-31初級

Gemini APIで「Unsupported MIME type」エラーが出るときの原因と対処

画像や音声をGemini APIに渡したときに発生する『Unsupported MIME type』エラーを、MIMEタイプの綴り間違い・octet-stream問題・非対応フォーマットの3つの観点から切り分けて、確実に動くコードで解決します。

Gemini API/2026-05-18中級

Gemini Vision で壁紙アプリの自動カテゴリ分類を実装した話

個人開発の壁紙アプリで Gemini Vision API を使い、画像の自動カテゴリ分類を実装した実体験です。精度改善のプロセスと、公式ドキュメントには載っていない落とし穴、GPT-4o Vision とのコスト比較までまとめました。

Gemini API/2026-05-16中級

Gemini Vision で壁紙アプリのカテゴリ自動分類を試した — 精度と落とし穴の実記録

壁紙アプリの画像カテゴリ自動分類を Gemini Vision で実装した記録。精度67%から87%への改善手順と、confidence 閾値で人間レビューを全体の15%に絞り込む運用設計を紹介します。

Gemini API/2026-05-09中級

Gemini API に画像を送る前に Pillow で縮小しておくべき理由

Gemini API のマルチモーダル入力で iPhone の写真をそのまま投げているとレイテンシも料金も静かに膨らみます。Pillow で前処理するだけで結果が変わった実例と、私が普段使っている縮小関数をまとめました。

Gemini 応用/2026-05-06上級

Gemini マルチモーダル API で画像・音声・動画を統合処理する有料サービスの実装

Gemini のマルチモーダル機能(画像・音声・動画・PDF)を組み合わせた有料サービスの実装ガイド。Stripe課金フロー、モデル使い分け、エラーハンドリングまで実践コードで解説します。

Gemini API/2026-04-30中級

Gemini API に画像を渡しても「画像が見えません」と返るときの診断と対処

Gemini API に画像を入力したのに『画像は添付されていません』と返ってくる現象の原因を、mime_type・サイズ・SDK差・モデル選択の4視点で切り分け、コピペで動く修正コードまで一気通貫で解説します。

Gemini API/2026-04-28上級

Gemini 2.5 Pro の空間理解(バウンディングボックス・セグメンテーション)を本番アプリで使いこなす

Gemini 2.5 Pro の空間理解出力を本番のモバイル/Webアプリに組み込むための実装ガイド。座標正規化・マスクのデコード・ハルシネーション検出・YOLOへの自動フォールバックまで、動作するコードと共に解説します。

Gemini API/2026-04-26中級

Gemini API で動画から多言語字幕(SRT/VTT)を生成する実装パターン

Gemini API のマルチモーダル動画入力を使い、SRT/VTT 形式の多言語字幕を生成する実装パターンをまとめました。タイムスタンプ精度と翻訳品質を両立させるプロンプト設計を解説します。

Gemini API/2026-04-15中級

Gemini 2.5 Pro でつくるAIドキュメントアシスタント — PDF・画像・テキストを一括解析してMarkdownレポートを自動生成する

Gemini 2.5 Pro の File API とマルチモーダル機能を活用し、PDF・画像・テキストを一括解析してMarkdownレポートを自動生成するPythonスクリプトを実装します。実務で使えるコード付きで解説します。