Omni Flash の 4K を API 側で受け取るか、配布直前に自分で上げるか
Gemini Omni Flash の 1080p と 4K はアップスケール出力です。解像度を引き上げる地点を配布先から逆算して決める手順と、受け取った動画の細部を自分で確かめる方法をまとめました。
Omni Flash で短尺動画から SNS 告知メタデータを1パス抽出する
公開プレビューの Gemini Omni Flash に短尺動画を1回渡すだけで、告知文・チャプター・見せ場タイムスタンプを構造化 JSON で受け取る実装をまとめます。フレーム抽出を挟む多コール構成との違い、fps と media_resolution の効かせどころ、1本あたりのコスト試算まで、個人開発の告知作業を回す視点で扱います。
Gemini マルチモーダル API で画像・音声・動画を統合処理する有料サービスの実装
Gemini のマルチモーダル機能で画像・音声・動画・PDF を統合処理する有料サービスの作り方を解説します。File API の使い方、ユースケース別の実装パターン、Stripe Metered Billing との連携、利益率を保つ料金設計まで実践コードつきです。
Gemini API で動画から多言語字幕(SRT/VTT)を生成する実装パターン
Gemini API の動画入力から SRT / VTT 形式の多言語字幕を生成する実装パターンです。2つの動画の渡し方の使い分け、タイムスタンプ精度を上げる3つのコツ、多言語字幕を1リクエストで完結させる方法、公開前の軽量 QA パスまでまとめました。
Gemini API マルチモーダル実践テクニック集 — 画像・動画・音声・PDFを自在に扱う
画像・動画・音声・PDF を単一リクエストで扱う Gemini API のマルチモーダル実装テクニック集です。4モダリティの基礎実装から、ストリーミング対応パイプライン、Function Calling との統合、レート制限対策、パフォーマンスとコストの最適化まで進めます。
AI朗読動画の作り方2026 — ブログ記事をYouTubeに変換する最新ワークフロー
ブログ記事を YouTube の朗読動画へ変換する2026年のワークフローを解説します。Gemini TTS での音声生成、Veo 3.1 による背景動画の自動生成、Vrew での字幕付けとテキストベース編集、スクリプト最適化まで、無料から低コストで進める全5ステップです。