GEMINI LABEN
VIDEO — 9月1日、エージェント型の動画理解が 3.7 Flash・3.6 Flash・3.5 Flash-Lite に届きました。モデルが動画のタイムラインを自分で辿りますTOKENS — 必要なときだけ字幕・フレーム・音声を取りに行く方式で、長尺では従来処理に比べて最大88%のトークン削減とされていますSCOPE — 対応は Interactions API と GenerateContent API の両方です。長い動画を扱う見積もりは、この変更で前提が変わりますMUSIC — 9月3日、Lyria 3.5 がパブリックプレビューへ。フルレングスの楽曲生成に対応し、44.1kHz ステレオを出力しますCONTROL — Lyria 3.5 はテキストと画像を入力に取り、音楽的な一貫性、自然なボーカル、尺と構成の細かい制御が改善されましたROBOTICS — gemini-robotics-er-2-streaming-preview は Live API 上のリアルタイム配信向けで、物理動作に対するブロッキング挙動つきの function calling に対応しますVIDEO — 9月1日、エージェント型の動画理解が 3.7 Flash・3.6 Flash・3.5 Flash-Lite に届きました。モデルが動画のタイムラインを自分で辿りますTOKENS — 必要なときだけ字幕・フレーム・音声を取りに行く方式で、長尺では従来処理に比べて最大88%のトークン削減とされていますSCOPE — 対応は Interactions API と GenerateContent API の両方です。長い動画を扱う見積もりは、この変更で前提が変わりますMUSIC — 9月3日、Lyria 3.5 がパブリックプレビューへ。フルレングスの楽曲生成に対応し、44.1kHz ステレオを出力しますCONTROL — Lyria 3.5 はテキストと画像を入力に取り、音楽的な一貫性、自然なボーカル、尺と構成の細かい制御が改善されましたROBOTICS — gemini-robotics-er-2-streaming-preview は Live API 上のリアルタイム配信向けで、物理動作に対するブロッキング挙動つきの function calling に対応します
TAG

tts

10 記事
タグ一覧に戻る
関連タグ:
gemini-api3gemini3Gemini API2ストリーミング2youtube2narration2音声処理1Python1cache1cost-optimization1mobile-app1音声生成1
Gemini API/2026-08-23中級

Gemini TTS を streamGenerateContent で受け取り、先頭のチャンクから鳴らす

Gemini の TTS をストリーミングで受け取ると、音声は「ファイル」ではなく PCM の断片で届きます。チャンクごとに WAV ヘッダを付けた場合に何が起きるかを手元で測り、連結とヘッダの正しい順序を実装まで示します。

Gemini 開発/2026-07-11上級

同じナレーションを二度生成しない — TTS 音声を端末にキャッシュする鍵設計と失効の運用

瞑想・癒し系アプリのように同じ音声を何度も再生する場面で、Gemini TTS の出力そのものをキャッシュしてコストを実質ゼロに近づける設計です。テキストだけでは足りないキャッシュキーの組み立て方、サーバ生成キャッシュと端末キャッシュの二層構成、モデル停止期限への備えとしての失効ポリシーを、動くコードと実測値でまとめました。

Gemini 開発/2026-07-03上級

音声が全部できるまで待たせない — Gemini TTS ストリーミング生成を配信経路に組み込む設計

gemini-3.1-flash-tts-preview が streamGenerateContent に対応しました。最初の音が出るまで実測1.8秒の配信経路を、PCM境界処理・文単位の再開・preview停止フォールバックまで含めて設計します。

Gemini API/2026-05-14中級

Gemini TTS API を SwiftUI アプリに組み込む — AVAudioEngine との連携で詰まった2つの問題

Gemini TTS API が返す PCM データを SwiftUI + AVAudioEngine で再生する実装を解説。PCM フォーマット変換と AVAudioSession 設定の2つの落とし穴を、実際のコードとともに紹介します。

Gemini 開発/2026-05-06中級

Gemini TTS で朗読動画を全自動生成するパイプライン — テキスト入力から MP4 出力まで(2026年実践)

Gemini TTS API でテキストを音声に変換し、SRT 字幕と背景画像を FFmpeg で合成して朗読動画を全自動生成するパイプラインを Python で実装します。テキスト入力から MP4 出力までの4ステップと、API コスト・処理時間の実測値を公開します。

Gemini API/2026-04-12中級

Gemini 2.5 Flash TTS で音声アプリを作る ― 低レイテンシ音声合成の実装からプロダクション最適化まで

Gemini 2.5 Flash TTS を使った音声アプリの構築手順を実装コードつきで解説します。Pro TTS との選択基準、ストリーミング再生で体感レイテンシを縮める方法、話し方の表現力の制御、不要な音声合成を減らすコスト最適化まで扱います。

Gemini 開発/2026-03-22中級

Gemini TTS + Veo 3.1で朗読チャンネルを構築する

Gemini TTS と Veo 3.1 で YouTube の朗読チャンネルをゼロから構築する方法です。TTS API の仕様と声の選択戦略、Veo 3.1 による動画生成パイプライン、完全自動化の組み立て、コスト分析と最適化まで、スケールさせるための実装を詳しく解説します。

Gemini 基礎/2026-03-22初級

AI朗読動画の作り方2026 — ブログ記事をYouTubeに変換する最新ワークフロー

ブログ記事を YouTube の朗読動画へ変換する2026年のワークフローを解説します。Gemini TTS での音声生成、Veo 3.1 による背景動画の自動生成、Vrew での字幕付けとテキストベース編集、スクリプト最適化まで、無料から低コストで進める全5ステップです。

Gemini 開発/2026-03-20初級

Google AI Studio 2026年大型アップデート — 統合Playground・Maps Grounding・開発者体験の全面刷新

2026年3月のGoogle AI Studio大型アップデートを徹底解説。統合Playground、Maps Grounding、Built-in Tools併用、リアルタイム使用量追跡など、開発者体験を一変させる新機能を網羅。

Gemini 応用/2026-03-12中級

Gemini の音声合成を実務で使う — 声の選び方・ペーシング・運用コストの勘所

Gemini の TTS(音声合成)を個人開発のアプリに組み込んだ実務メモ。google-genai SDK での呼び出し、生 PCM を WAV に整える落とし穴、声とペーシングの選び方、コストの見方までを実例とともにまとめます。