Gemini TTS を streamGenerateContent で受け取り、先頭のチャンクから鳴らす
Gemini の TTS をストリーミングで受け取ると、音声は「ファイル」ではなく PCM の断片で届きます。チャンクごとに WAV ヘッダを付けた場合に何が起きるかを手元で測り、連結とヘッダの正しい順序を実装まで示します。
同じナレーションを二度生成しない — TTS 音声を端末にキャッシュする鍵設計と失効の運用
瞑想・癒し系アプリのように同じ音声を何度も再生する場面で、Gemini TTS の出力そのものをキャッシュしてコストを実質ゼロに近づける設計です。テキストだけでは足りないキャッシュキーの組み立て方、サーバ生成キャッシュと端末キャッシュの二層構成、モデル停止期限への備えとしての失効ポリシーを、動くコードと実測値でまとめました。
音声が全部できるまで待たせない — Gemini TTS ストリーミング生成を配信経路に組み込む設計
gemini-3.1-flash-tts-preview が streamGenerateContent に対応しました。最初の音が出るまで実測1.8秒の配信経路を、PCM境界処理・文単位の再開・preview停止フォールバックまで含めて設計します。
Gemini TTS API を SwiftUI アプリに組み込む — AVAudioEngine との連携で詰まった2つの問題
Gemini TTS API が返す PCM データを SwiftUI + AVAudioEngine で再生する実装を解説。PCM フォーマット変換と AVAudioSession 設定の2つの落とし穴を、実際のコードとともに紹介します。
Gemini TTS で朗読動画を全自動生成するパイプライン — テキスト入力から MP4 出力まで(2026年実践)
Gemini TTS API でテキストを音声に変換し、SRT 字幕と背景画像を FFmpeg で合成して朗読動画を全自動生成するパイプラインを Python で実装します。テキスト入力から MP4 出力までの4ステップと、API コスト・処理時間の実測値を公開します。
Gemini 2.5 Flash TTS で音声アプリを作る ― 低レイテンシ音声合成の実装からプロダクション最適化まで
Gemini 2.5 Flash TTS を使った音声アプリの構築手順を実装コードつきで解説します。Pro TTS との選択基準、ストリーミング再生で体感レイテンシを縮める方法、話し方の表現力の制御、不要な音声合成を減らすコスト最適化まで扱います。
Gemini TTS + Veo 3.1で朗読チャンネルを構築する
Gemini TTS と Veo 3.1 で YouTube の朗読チャンネルをゼロから構築する方法です。TTS API の仕様と声の選択戦略、Veo 3.1 による動画生成パイプライン、完全自動化の組み立て、コスト分析と最適化まで、スケールさせるための実装を詳しく解説します。
AI朗読動画の作り方2026 — ブログ記事をYouTubeに変換する最新ワークフロー
ブログ記事を YouTube の朗読動画へ変換する2026年のワークフローを解説します。Gemini TTS での音声生成、Veo 3.1 による背景動画の自動生成、Vrew での字幕付けとテキストベース編集、スクリプト最適化まで、無料から低コストで進める全5ステップです。
Google AI Studio 2026年大型アップデート — 統合Playground・Maps Grounding・開発者体験の全面刷新
2026年3月のGoogle AI Studio大型アップデートを徹底解説。統合Playground、Maps Grounding、Built-in Tools併用、リアルタイム使用量追跡など、開発者体験を一変させる新機能を網羅。
Gemini の音声合成を実務で使う — 声の選び方・ペーシング・運用コストの勘所
Gemini の TTS(音声合成)を個人開発のアプリに組み込んだ実務メモ。google-genai SDK での呼び出し、生 PCM を WAV に整える落とし穴、声とペーシングの選び方、コストの見方までを実例とともにまとめます。