GEMINI LABEN
ROBOTICS — 8月31日に停止した ER 1.6 preview には後継があります。Gemini Robotics ER 2 が公開プレビュー中で、通常版とストリーミング版の2種類が提供されていますVIDEO — ER 2 の成功・失敗判定は静止画ではなく生の映像フィード上で動きます。こぼれ・滑り・位置ずれのような、実行の途中で起きる失敗を捉えられる設計ですDEADLINE — 次の期限は9月30日、gemini-omni-flash-preview の廃止です。移行先は8月27日に GA になった gemini-omni-1.1-flash で、残り4週間を切りましたAPIKEY — 残りの標準 API キーは、制限付きのものも含めて9月中に全面停止します。移行先は Google Cloud サービスアカウントに紐付く auth キー形式ですPRICE — Gemini 3.7 Flash の導入価格 $0.75/$3.75 per 1M は12月31日までです。2027年1月1日から $1.50/$7.50 になるため、年を跨ぐ見積もりは2本立てが要りますAUDIO — Gemini 3.5 Transcribe は85言語以上の言語検出、話者ダイアライゼーション、単語単位タイムスタンプ、最大1,000語のカスタム語彙バイアスに対応していますROBOTICS — 8月31日に停止した ER 1.6 preview には後継があります。Gemini Robotics ER 2 が公開プレビュー中で、通常版とストリーミング版の2種類が提供されていますVIDEO — ER 2 の成功・失敗判定は静止画ではなく生の映像フィード上で動きます。こぼれ・滑り・位置ずれのような、実行の途中で起きる失敗を捉えられる設計ですDEADLINE — 次の期限は9月30日、gemini-omni-flash-preview の廃止です。移行先は8月27日に GA になった gemini-omni-1.1-flash で、残り4週間を切りましたAPIKEY — 残りの標準 API キーは、制限付きのものも含めて9月中に全面停止します。移行先は Google Cloud サービスアカウントに紐付く auth キー形式ですPRICE — Gemini 3.7 Flash の導入価格 $0.75/$3.75 per 1M は12月31日までです。2027年1月1日から $1.50/$7.50 になるため、年を跨ぐ見積もりは2本立てが要りますAUDIO — Gemini 3.5 Transcribe は85言語以上の言語検出、話者ダイアライゼーション、単語単位タイムスタンプ、最大1,000語のカスタム語彙バイアスに対応しています
TAG

TTS

10 記事
タグ一覧に戻る
関連タグ:
gemini-api3gemini3Gemini API2ストリーミング2youtube2narration2音声処理1Python1cache1cost-optimization1mobile-app1音声生成1
Gemini API/2026-08-23中級

Gemini TTS を streamGenerateContent で受け取り、先頭のチャンクから鳴らす

Gemini の TTS をストリーミングで受け取ると、音声は「ファイル」ではなく PCM の断片で届きます。チャンクごとに WAV ヘッダを付けた場合に何が起きるかを手元で測り、連結とヘッダの正しい順序を実装まで示します。

Gemini 開発/2026-07-11上級

同じナレーションを二度生成しない — TTS 音声を端末にキャッシュする鍵設計と失効の運用

瞑想・癒し系アプリのように同じ音声を何度も再生する場面で、Gemini TTS の出力そのものをキャッシュしてコストを実質ゼロに近づける設計です。テキストだけでは足りないキャッシュキーの組み立て方、サーバ生成キャッシュと端末キャッシュの二層構成、モデル停止期限への備えとしての失効ポリシーを、動くコードと実測値でまとめました。

Gemini 開発/2026-07-03上級

音声が全部できるまで待たせない — Gemini TTS ストリーミング生成を配信経路に組み込む設計

gemini-3.1-flash-tts-preview が streamGenerateContent に対応しました。最初の音が出るまで実測1.8秒の配信経路を、PCM境界処理・文単位の再開・preview停止フォールバックまで含めて設計します。

Gemini API/2026-05-14中級

Gemini TTS API を SwiftUI アプリに組み込む — AVAudioEngine との連携で詰まった2つの問題

Gemini TTS API が返す PCM データを SwiftUI + AVAudioEngine で再生する実装を解説。PCM フォーマット変換と AVAudioSession 設定の2つの落とし穴を、実際のコードとともに紹介します。

Gemini 開発/2026-05-06中級

Gemini TTS で朗読動画を全自動生成するパイプライン — テキスト入力から MP4 出力まで(2026年実践)

Gemini TTS API でテキストを音声に変換し、SRT 字幕と背景画像を FFmpeg で合成して朗読動画を全自動生成するパイプラインを Python で実装します。テキスト入力から MP4 出力までの4ステップと、API コスト・処理時間の実測値を公開します。

Gemini API/2026-04-12中級

Gemini 2.5 Flash TTS で音声アプリを作る ― 低レイテンシ音声合成の実装からプロダクション最適化まで

Gemini 2.5 Flash TTS を使った音声アプリの構築手順を実装コードつきで解説します。Pro TTS との選択基準、ストリーミング再生で体感レイテンシを縮める方法、話し方の表現力の制御、不要な音声合成を減らすコスト最適化まで扱います。

Gemini 開発/2026-03-22中級

Gemini TTS + Veo 3.1で朗読チャンネルを構築する

Gemini TTS と Veo 3.1 で YouTube の朗読チャンネルをゼロから構築する方法です。TTS API の仕様と声の選択戦略、Veo 3.1 による動画生成パイプライン、完全自動化の組み立て、コスト分析と最適化まで、スケールさせるための実装を詳しく解説します。

Gemini 基礎/2026-03-22初級

AI朗読動画の作り方2026 — ブログ記事をYouTubeに変換する最新ワークフロー

ブログ記事を YouTube の朗読動画へ変換する2026年のワークフローを解説します。Gemini TTS での音声生成、Veo 3.1 による背景動画の自動生成、Vrew での字幕付けとテキストベース編集、スクリプト最適化まで、無料から低コストで進める全5ステップです。

Gemini 開発/2026-03-20初級

Google AI Studio 2026年大型アップデート — 統合Playground・Maps Grounding・開発者体験の全面刷新

2026年3月のGoogle AI Studio大型アップデートを徹底解説。統合Playground、Maps Grounding、Built-in Tools併用、リアルタイム使用量追跡など、開発者体験を一変させる新機能を網羅。

Gemini 応用/2026-03-12中級

Gemini の音声合成を実務で使う — 声の選び方・ペーシング・運用コストの勘所

Gemini の TTS(音声合成)を個人開発のアプリに組み込んだ実務メモ。google-genai SDK での呼び出し、生 PCM を WAV に整える落とし穴、声とペーシングの選び方、コストの見方までを実例とともにまとめます。