関連タグ:
⬡ Gemini 応用/2026-05-06上級
Gemini マルチモーダル API で画像・音声・動画を統合処理する有料サービスの実装
Gemini のマルチモーダル機能で画像・音声・動画・PDF を統合処理する有料サービスの作り方を解説します。File API の使い方、ユースケース別の実装パターン、Stripe Metered Billing との連携、利益率を保つ料金設計まで実践コードつきです。
◈ Gemini API/2026-05-01中級
Gemini API で会議音声から話者を識別する — 簡易ダイアリゼーションの実装ガイド
会議録音やポッドキャストの音声から「誰が話したか」を Gemini API のマルチモーダル音声理解で識別する方法です。話者ラベルつき JSON を返す最小構成のコード、結果を底上げする3つのプロンプトの工夫、専用ツールとの使い分けを解説します。
◈ Gemini API/2026-03-30中級
Gemini API × Python で音声ファイルを文字起こし・要約するアプリを作る方法
Gemini API のマルチモーダル機能と Python で、音声ファイルの文字起こしと自動要約を行うアプリを作ります。基本の文字起こしから要約機能の追加、長時間音声の分割処理、複数ファイルの一括処理まで、4つのステップに分けて手を動かしながら進めます。
◈ Gemini API/2026-03-26上級
Gemini API マルチモーダル実践テクニック集 — 画像・動画・音声・PDFを自在に扱う
画像・動画・音声・PDF を単一リクエストで扱う Gemini API のマルチモーダル実装テクニック集です。4モダリティの基礎実装から、ストリーミング対応パイプライン、Function Calling との統合、レート制限対策、パフォーマンスとコストの最適化まで進めます。
⬡ Gemini 応用/2026-03-12中級
Gemini の音声合成を実務で使う — 声の選び方・ペーシング・運用コストの勘所
Gemini の TTS(音声合成)を個人開発のアプリに組み込んだ実務メモ。google-genai SDK での呼び出し、生 PCM を WAV に整える落とし穴、声とペーシングの選び方、コストの見方までを実例とともにまとめます。