GEMINI LABEN
ROBOTICS — 8月31日に停止した ER 1.6 preview には後継があります。Gemini Robotics ER 2 が公開プレビュー中で、通常版とストリーミング版の2種類が提供されていますVIDEO — ER 2 の成功・失敗判定は静止画ではなく生の映像フィード上で動きます。こぼれ・滑り・位置ずれのような、実行の途中で起きる失敗を捉えられる設計ですDEADLINE — 次の期限は9月30日、gemini-omni-flash-preview の廃止です。移行先は8月27日に GA になった gemini-omni-1.1-flash で、残り4週間を切りましたAPIKEY — 残りの標準 API キーは、制限付きのものも含めて9月中に全面停止します。移行先は Google Cloud サービスアカウントに紐付く auth キー形式ですPRICE — Gemini 3.7 Flash の導入価格 $0.75/$3.75 per 1M は12月31日までです。2027年1月1日から $1.50/$7.50 になるため、年を跨ぐ見積もりは2本立てが要りますAUDIO — Gemini 3.5 Transcribe は85言語以上の言語検出、話者ダイアライゼーション、単語単位タイムスタンプ、最大1,000語のカスタム語彙バイアスに対応していますROBOTICS — 8月31日に停止した ER 1.6 preview には後継があります。Gemini Robotics ER 2 が公開プレビュー中で、通常版とストリーミング版の2種類が提供されていますVIDEO — ER 2 の成功・失敗判定は静止画ではなく生の映像フィード上で動きます。こぼれ・滑り・位置ずれのような、実行の途中で起きる失敗を捉えられる設計ですDEADLINE — 次の期限は9月30日、gemini-omni-flash-preview の廃止です。移行先は8月27日に GA になった gemini-omni-1.1-flash で、残り4週間を切りましたAPIKEY — 残りの標準 API キーは、制限付きのものも含めて9月中に全面停止します。移行先は Google Cloud サービスアカウントに紐付く auth キー形式ですPRICE — Gemini 3.7 Flash の導入価格 $0.75/$3.75 per 1M は12月31日までです。2027年1月1日から $1.50/$7.50 になるため、年を跨ぐ見積もりは2本立てが要りますAUDIO — Gemini 3.5 Transcribe は85言語以上の言語検出、話者ダイアライゼーション、単語単位タイムスタンプ、最大1,000語のカスタム語彙バイアスに対応しています
ブログ一覧

今週のGemini ハイライト(3/28〜4/3)— Computer Use が本格化、Live 3.1 に感動した一週間

週間まとめGeminiComputer UseGemini LiveGoogle ADK週次ハイライト

こんにちは。Gemini Lab 編集部の廣川政樹です。

4月最初の週が終わりました。今週の Gemini Lab は、ひとことで言うと 「Gemini がコンピューターを操る」週でした。Computer Use 関連の記事が一気に充実し、Gemini Live 3.1 の実践ガイドや Lyria 3 Pro の音楽生成ガイドまで、かなり盛りだくさんな内容になりました。

週の終わりに、どんな記事を公開したか振り返ってみようと思います。

今週いちばん書きたかった記事:Gemini Computer Use

正直に言うと、今週いちばんテンションが上がったのは Gemini Computer Use の特集です。

「AIがブラウザを自動操作する」という概念自体は以前からありましたが、Gemini 3.1 Pro の Computer Use API が本格的に使えるようになり、実際に動かしてみると思った以上に実用的でした。

今週は3本に渡って Computer Use を掘り下げました。

まず基本として Gemini Computer Use 完全ガイド:セットアップからブラウザ自動化まで実践解説 を書きました。API キーの取得から始まり、実際にブラウザを制御するPythonコードまで、ゼロから動かせるように構成しています。

続いて、より実践的な Gemini Computer Use 実践活用ガイド — フォーム自動入力・データ抽出・ブラウザRPA では、フォームの自動入力やWebスクレイピング、RPAの代替としての活用パターンを紹介しています。この記事では「毎日手作業でやっていた作業が全自動になった」という実感を持てるような事例を選びました。

そして業務レベルの活用を考える方向けに Gemini Computer Use で構築する業務自動化ワークフロー も公開しました。単発の操作ではなく、複数ステップのワークフローとして組み立てる設計パターンに焦点を当てています。

Computer Use はまだ実験的な機能ですが、試してみると「あ、これは本物だ」という感触があります。自動化の可能性を広げてくれる技術として、引き続き注目していきたいと思っています。

Gemini Live 3.1 — 会話AIの「空気感」が変わった

今週もうひとつ驚かされたのが、Gemini Live 3.1 実践ガイド:高速化・コンテキスト2倍・感情認識 です。

レスポンス速度の改善と、コンテキストウィンドウの倍増は予想の範囲内でした。でも「感情認識」の部分が想定以上の変化でした。こちらの話し方のトーンに合わせて返答のトーンが変わる——言語化するとシンプルなのですが、実際に体験すると「ちゃんと聴いてもらえている」という感覚があります。

AIとの会話は、これまでどこかテキスト的な乾いた感触がありました。それが Gemini Live 3.1 では少し変わったように感じています。チュートリアルから発展的な活用例まで、実際に試せる形で記事にまとめましたので、ぜひご覧ください。

Google ADK × TypeScript — 本番マルチエージェントの時代へ

Google ADK × Gemini — TypeScript本番マルチエージェントシステム構築 は、個人的にも「これを待っていた」という感覚の強い記事です。

Google の Agent Development Kit(ADK)が TypeScript で本番利用できるようになったことで、フロントエンドや Node.js 系の開発者も Gemini ベースのマルチエージェントシステムを構築しやすくなりました。Pythonが中心だった時期と比べると、選択肢が大きく広がっています。

記事では複数エージェントの協調動作、エラーハンドリング、本番環境でのデプロイまで踏み込んでいます。TypeScript で AI エージェントを書きたい方に読んでいただきたい内容です。

今週のもうひとつの注目:音楽生成と電子透かし

少し毛色の違う記事として、Gemini Lyria 3 Proで3分の楽曲を生成する完全ガイド を公開しました。

歌詞・ジャンル・感情を指定して楽曲を生成する——文章だけでなく、音楽まで AI が作れる時代になったことをあらためて実感します。ミュージシャンや動画制作者の方にとっても、BGM 制作のコストが劇的に変わる可能性があります。

また Google SynthID 完全ガイド — AI生成コンテンツの電子透かし技術と検出の仕組み も合わせて公開しました。AI生成コンテンツが増える中で、「これは AI が作ったのか」を透明性を持って示す技術の重要性は今後ますます高まると思います。

来週に向けて

4月に入り、Google I/O 2026 に向けて新しい発表が続くことが予想されます。Gemini 3.1 Pro のさらなる機能拡充、Workspace 連携の深化、そして日本語対応の改善——Gemini Lab でも引き続き最新情報をキャッチアップしながら、実践的な記事をお届けしていきます。

来週もよろしくお願いします。

Gemini や AI 活用についてご質問・ご要望があれば、お気軽にお声がけください。

Gemini を使った開発や自動化についてさらに深く学びたい方には、Google Gemini APIの公式ドキュメントとあわせて、Gemini API 全般を体系的に解説した Generative AI with LangChain(Ben Auffarth 著) もおすすめです。実装から本番運用まで丁寧にカバーされています。