GEMINI LABEN
VIDEO — 9月1日、エージェント型の動画理解が 3.7 Flash・3.6 Flash・3.5 Flash-Lite に届きました。モデルが動画のタイムラインを自分で辿りますTOKENS — 必要なときだけ字幕・フレーム・音声を取りに行く方式で、長尺では従来処理に比べて最大88%のトークン削減とされていますSCOPE — 対応は Interactions API と GenerateContent API の両方です。長い動画を扱う見積もりは、この変更で前提が変わりますMUSIC — 9月3日、Lyria 3.5 がパブリックプレビューへ。フルレングスの楽曲生成に対応し、44.1kHz ステレオを出力しますCONTROL — Lyria 3.5 はテキストと画像を入力に取り、音楽的な一貫性、自然なボーカル、尺と構成の細かい制御が改善されましたROBOTICS — gemini-robotics-er-2-streaming-preview は Live API 上のリアルタイム配信向けで、物理動作に対するブロッキング挙動つきの function calling に対応しますVIDEO — 9月1日、エージェント型の動画理解が 3.7 Flash・3.6 Flash・3.5 Flash-Lite に届きました。モデルが動画のタイムラインを自分で辿りますTOKENS — 必要なときだけ字幕・フレーム・音声を取りに行く方式で、長尺では従来処理に比べて最大88%のトークン削減とされていますSCOPE — 対応は Interactions API と GenerateContent API の両方です。長い動画を扱う見積もりは、この変更で前提が変わりますMUSIC — 9月3日、Lyria 3.5 がパブリックプレビューへ。フルレングスの楽曲生成に対応し、44.1kHz ステレオを出力しますCONTROL — Lyria 3.5 はテキストと画像を入力に取り、音楽的な一貫性、自然なボーカル、尺と構成の細かい制御が改善されましたROBOTICS — gemini-robotics-er-2-streaming-preview は Live API 上のリアルタイム配信向けで、物理動作に対するブロッキング挙動つきの function calling に対応します
TAG

画像認識

5 記事
タグ一覧に戻る
関連タグ:
マルチモーダル4Gemini API3個人開発2gemini-api1iOS1Android1モバイルアプリ1音声解析1AI機能1Swift1Kotlin1収益化1
Gemini API/2026-07-03上級

Gemini API で iOS/Android アプリに AI 機能を実装する 2026 — 画像認識・音声解析・チャット・収益化まで

Gemini API で iOS/Android アプリに画像認識・音声解析・AIチャットを組み込む際の設計パターンとコスト最適化を、個人開発の実測値とともに整理します。Gemma 4 振り分けと API キー制限必須化への対応も追記しました。

Gemini 応用/2026-06-04中級

Gemini の画像理解で壁紙アプリの審査リスクを事前点検した2週間の運用メモ

壁紙アプリの新規バッチを提出する前に、Gemini の画像理解でストア審査リスクを事前点検した2週間の運用メモです。商標の写り込みなど何を拾えて何を拾えなかったか、コストと処理時間の実測、目視チェックとの役割分担を個人開発の視点で記録しました。

Gemini 応用/2026-05-13中級

Gemini Vision に自分のアートワークを見せてみた — 作り手と開発者、二つの視点からの正直なレビュー

自作のアート画像を Gemini Vision に分析させ、AI が何を読み取り、何を見落としたかを検証しました。壁紙アプリ運営での実用的な使いどころと、現状の限界を個人開発者の視点で正直にまとめます。

Gemini API/2026-03-28上級

Gemini API で実現するマルチモーダル文書解析システム — 画像・PDF・動画を統合処理する実践アーキテクチャ

Gemini API のマルチモーダル機能を活用し、画像・PDF・動画を統合的に解析するシステムの設計と実装を解説。ファイルアップロードから構造化データ抽出、バッチ処理パイプラインの構築まで実践的にカバーします。

Gemini API/2026-03-19上級

Unity × Gemini マルチモーダル AI 実装 完全コード集【上級編】

Unity に Gemini API のマルチモーダル機能(テキスト+画像+音声)を統合する完全実装ガイド。ストリーミング応答、画像認識NPC、音声対話システム、コンテキスト管理まで本番レベルのC#コードを公開。