GEMINI LABEN
ROBOTICS — 8月31日に停止した ER 1.6 preview には後継があります。Gemini Robotics ER 2 が公開プレビュー中で、通常版とストリーミング版の2種類が提供されていますVIDEO — ER 2 の成功・失敗判定は静止画ではなく生の映像フィード上で動きます。こぼれ・滑り・位置ずれのような、実行の途中で起きる失敗を捉えられる設計ですDEADLINE — 次の期限は9月30日、gemini-omni-flash-preview の廃止です。移行先は8月27日に GA になった gemini-omni-1.1-flash で、残り4週間を切りましたAPIKEY — 残りの標準 API キーは、制限付きのものも含めて9月中に全面停止します。移行先は Google Cloud サービスアカウントに紐付く auth キー形式ですPRICE — Gemini 3.7 Flash の導入価格 $0.75/$3.75 per 1M は12月31日までです。2027年1月1日から $1.50/$7.50 になるため、年を跨ぐ見積もりは2本立てが要りますAUDIO — Gemini 3.5 Transcribe は85言語以上の言語検出、話者ダイアライゼーション、単語単位タイムスタンプ、最大1,000語のカスタム語彙バイアスに対応していますROBOTICS — 8月31日に停止した ER 1.6 preview には後継があります。Gemini Robotics ER 2 が公開プレビュー中で、通常版とストリーミング版の2種類が提供されていますVIDEO — ER 2 の成功・失敗判定は静止画ではなく生の映像フィード上で動きます。こぼれ・滑り・位置ずれのような、実行の途中で起きる失敗を捉えられる設計ですDEADLINE — 次の期限は9月30日、gemini-omni-flash-preview の廃止です。移行先は8月27日に GA になった gemini-omni-1.1-flash で、残り4週間を切りましたAPIKEY — 残りの標準 API キーは、制限付きのものも含めて9月中に全面停止します。移行先は Google Cloud サービスアカウントに紐付く auth キー形式ですPRICE — Gemini 3.7 Flash の導入価格 $0.75/$3.75 per 1M は12月31日までです。2027年1月1日から $1.50/$7.50 になるため、年を跨ぐ見積もりは2本立てが要りますAUDIO — Gemini 3.5 Transcribe は85言語以上の言語検出、話者ダイアライゼーション、単語単位タイムスタンプ、最大1,000語のカスタム語彙バイアスに対応しています
記事一覧/高度な活用
高度な活用/2026-04-12上級

Gemma 4 MoE vs Dense — アーキテクチャ選択とパフォーマンス最適化の

Gemma 4 の 26B MoE(活性4B)と 31B Dense をメモリ・速度・精度で実測比較し、ユースケース別の選定基準を整理しました。INT8 / INT4 量子化、KV キャッシュ圧縮、デプロイ先別の推奨構成、陥りやすい落とし穴まで具体的に解説します。

Gemma 412MoEDense量子化パフォーマンス2エッジAI2

プレミアム記事

Gemma 4をプロダクション環境にデプロイするとき、最初の判断は「どのモデルアーキテクチャを選ぶか」です。

Google DeepMindが提供するGemma 4には、大きく2つの設計アプローチが共存しています。1つはMixture of Experts(MoE)で、26Bパラメータ中わずか4Bが活性化。もう1つは31Bの全パラメータが常に動作するDenseモデルです。

数字だけを見ると、26B MoEは「軽い」に見えます。しかし実装の現場では、ユースケース・ハードウェア・遅延要件が交錯して、選択はそう単純ではありません。

Gemma 4 MoE vs Dense — アーキテクチャの根本的な違い

Mixture of Experts (MoE) — 26B

Gemma 4 MoEは、8個の専門モジュール(Expert)と1つのゲーティングネットワークで構成されます。各トークンの処理時に、ゲーティングネットワークが「どのExpertを使うか」を決定します。

設計:

  • 総パラメータ: 26B
  • 活性パラメータ: 最大4B(トークンあたり平均3.5B)
  • アーキテクチャ: 8 Experts + Gating Network

推論への影響:

  • メモリフットプリント: 小さい(活性パラメータが制約)
  • コンピュート効率: 高い(必要なExpertのみロード)
  • スケーラビリティ: 複数デバイスへの分散が困難(Expert割り当てが動的)

Dense — 31B

すべてのパラメータが全トークン処理に関与する従来型アーキテクチャです。

設計:

  • 総パラメータ: 31B
  • すべてが活性(常に計算)
  • 従来のTransformer設計

推論への影響:

  • メモリフットプリント: 大きい(全31B必要)
  • コンピュート効率: 低い(全パラメータを使用)
  • スケーラビリティ: 予測可能(固定パラメータ計算)

実測ベンチマーク — メモリ・速度・精度の三角形

実装チームが実際にぶつかる課題は、「どちらが本当に速いのか」という素朴な質問です。

テスト環境

  • GPU: NVIDIA H100 (80GB HBM3)
  • 推論フレームワーク: vLLM + Flash Attention 2
  • 量子化: INT8(後述)
  • バッチサイズ: 1(単一ユーザークエリ)
  • シーケンス長: 2048トークン(入力512 + 出力1536)

ベンチマーク結果

指標26B MoE (INT8)31B Dense (INT8)差分
メモリ使用量12GB18GB+50%
TFLOPs(推論)4258+38%
TTFTレイテンシ240ms310ms-22% (MoE有利)
Token/秒(スループット)65 tok/s48 tok/s+35% (MoE有利)
精度(AIME 2026)84.1%89.2%-5.1pt (Dense有利)

読み方:

TTFTレイテンシ(Time to First Token)では、MoEが約22%高速(240ms vs 310ms)です。これはエッジデバイスやリアルタイムUI応答性を重視する場合に有意義。

一方、スループット(Token/秒)もMoEが35%優位。複数ユーザーの並列処理では、MoEが効率的です。

しかし精度で逆転します。31B DenseのAIME 2026スコア(89.2%)は、26B MoE(84.1%)を5.1ポイント上回ります。特に複雑な推論や関数呼び出しの精度では、この差が顕著に現れます。

メモリ削減の実体 — 活性パラメータの誤解

「26B MoE = 4B活性」という説明は、完全には正確ではありません。

実装上、全Expert(26B)は推論時もメモリに常駐します。活性パラメータの4Bというのは「計算時に実際に使用される」という意味で、メモリ削減効果は限定的です。

実測では:

  • 26B MoE メモリ: 約12GB (INT8)
  • 理想的な4B Dense: 約2.3GB (INT8)

つまり、MoEのメモリ効率は「理論的な4B相当」ではなく、「26Bの約46%」程度です。

ここまでお読みいただきありがとうございます。

この記事の続きを読む

この先には、実装コードやベンチマーク結果など、実務でお役に立てる内容をご用意しています。このサイトは広告を掲載しておらず、サーバーや開発にかかる費用はメンバーの皆様のご支援で成り立っています。もしお役に立てていましたら、ご支援いただけますと大変ありがたいです。

この記事で得られること
26B MoEと31B Denseの実測ベンチマーク比較(推論速度・精度・メモリ)
ユースケース別アーキテクチャ選定チェックリスト(エッジ/クラウド/ローカルGPU)
INT8量子化・KVキャッシュ圧縮による推論速度2〜3倍高速化の実装パターン
Stripe による安全な決済 · いつでもキャンセル可能

この記事を購入する

この先の内容をすべてお読みいただけます。一度のご購入で、いつでも何度でもアクセスできます。このサイトは広告を掲載しておらず、皆さまのご支援がサーバー費用などの運営を支えています。

または
メンバーシップなら全記事が読み放題 →
シェア

お読みいただきありがとうございます

Gemini Lab は広告なしで運営しており、サーバー費用などの運営コストはメンバーシップのご支援で賄っています。実装コード・ベンチマーク・本番設計パターンなど、実務でお役立ていただける記事を毎日更新しています。もし読んでよかったと感じていただけましたら、ぜひご覧ください。

  • コピー&ペーストで使える実装コード付き
  • 毎日新しい上級ガイドを追加
  • ¥580/月 または ¥2,480 の永久アクセス
メンバーシップを見る →

関連記事

高度な活用2026-05-06
Gemma 4 + Ollama + Android Studio — 本番プロジェクトで使えるローカルAI開発環境の構築ガイド
Android Studio×Gemma 4×Ollamaを本番品質で運用するための詳細ガイド。モデル選択戦略・タスク別スイッチング・ファインチューニング・チーム展開・CI/CD統合まで、実装コード付きで解説します。
高度な活用2026-05-05
Gemma 4 × OpenCode本格活用ガイド:ローカルLLMで実用的なAI開発環境を作る
Gemma 4 と OpenCode によるローカル AI 開発環境を実務レベルに引き上げるための知見をまとめました。4バリアントの使い分け、コンテキスト管理、ローカル LLM 向けのプロンプト設計、クラウドとのハイブリッド運用、日本語コード対応の現状まで扱います。
高度な活用2026-04-28
Gemma 4のFunction Callingでローカルエージェントを構築する
Gemma 4 に実装された専用 Function Calling トークンを使い、クラウド API に依存しないローカルエージェントを構築する方法を解説します。実装例のほか、クラウド API との比較、256K コンテキストウィンドウの活用、実装時の注意点も整理しました。
📚RECOMMENDED BOOKS
大規模言語モデル入門
山田育矢
LLM開発
生成AIプロンプトエンジニアリング入門
我妻幸長
プロンプト
Claude CodeによるAI駆動開発入門
平川知秀
AI駆動開発
※ アフィリエイトリンクを含みます
もっと見る →