GEMINI LABEN
VIDEO — 9月1日、エージェント型の動画理解が 3.7 Flash・3.6 Flash・3.5 Flash-Lite に届きました。モデルが動画のタイムラインを自分で辿りますTOKENS — 必要なときだけ字幕・フレーム・音声を取りに行く方式で、長尺では従来処理に比べて最大88%のトークン削減とされていますSCOPE — 対応は Interactions API と GenerateContent API の両方です。長い動画を扱う見積もりは、この変更で前提が変わりますMUSIC — 9月3日、Lyria 3.5 がパブリックプレビューへ。フルレングスの楽曲生成に対応し、44.1kHz ステレオを出力しますCONTROL — Lyria 3.5 はテキストと画像を入力に取り、音楽的な一貫性、自然なボーカル、尺と構成の細かい制御が改善されましたROBOTICS — gemini-robotics-er-2-streaming-preview は Live API 上のリアルタイム配信向けで、物理動作に対するブロッキング挙動つきの function calling に対応しますVIDEO — 9月1日、エージェント型の動画理解が 3.7 Flash・3.6 Flash・3.5 Flash-Lite に届きました。モデルが動画のタイムラインを自分で辿りますTOKENS — 必要なときだけ字幕・フレーム・音声を取りに行く方式で、長尺では従来処理に比べて最大88%のトークン削減とされていますSCOPE — 対応は Interactions API と GenerateContent API の両方です。長い動画を扱う見積もりは、この変更で前提が変わりますMUSIC — 9月3日、Lyria 3.5 がパブリックプレビューへ。フルレングスの楽曲生成に対応し、44.1kHz ステレオを出力しますCONTROL — Lyria 3.5 はテキストと画像を入力に取り、音楽的な一貫性、自然なボーカル、尺と構成の細かい制御が改善されましたROBOTICS — gemini-robotics-er-2-streaming-preview は Live API 上のリアルタイム配信向けで、物理動作に対するブロッキング挙動つきの function calling に対応します
記事一覧/高度な活用
高度な活用/2026-08-24上級

日本の版画か中国の版画かを Gemini に当てさせない来歴ゲート

浮世絵の壁紙アプリに素材を入れる前の来歴チェックを、モデルに国を当てさせる形から、紙に写っている痕跡だけを列挙させる形へ組み替えた記録です。判断の表をこちら側に置き、証拠が足りない入力は保留へ回す配線を、動くコードと運用の判断基準まで含めてまとめました。

gemini115vision5structured-output26classification2workflow7

プレミアム記事

唐美人を描いた日本の浮世絵と、中国の年画を並べて見ていたときのことです。私にはどちらも「中国風の絵」にしか見えませんでした。個人開発で続けている浮世絵の壁紙アプリに入れる素材ですから、中国の版画が混ざったまま配信するわけにはいきません。仕分けの手を止めて、そのまま数分固まっていました。

同じ問いを Gemini に投げてみると、どちらの画像に対しても迷いなく答えが返ってきます。しかも、返ってくる答えは私が期待した方向に寄っていました。「これは日本の浮世絵ですか」と聞けば、たいてい「はい」と返ってくるのです。

このやりとりで気づいたのは、精度の問題ではなく問いの立て方の問題だということでした。以来、来歴の判定はモデルに任せず、モデルには「紙の上に何が写っているか」だけを答えてもらう形に組み替えています。その配線と、そこに至るまでに捨てた案を残しておきます。

なお、扱っている画像は公有となった古い版画そのもので、生成されたものではありません。AI を使っているのは配信前の検査工程だけです。App Store と Google Play の両方に同じ素材を出しているため、取り下げが必要になったときの手間も二重になります。止めるなら配信前しかありません。

画題は最も目立つ手がかりで、最も外す手がかりです

日本の絵師は中国の画題を好んで描きました。唐美人、唐子、故事人物。画面の中央を占めるモチーフだけを見れば、それは中国の絵に見えます。逆に、中国の年画にも日本の版画によく似た構図と彩色のものがあります。

つまり、画面で最も面積を占める情報と、来歴を決める情報が一致していません。人間が最初に目を向ける場所と、答えのある場所がずれているわけです。

モデルに画像を丸ごと渡して「日本の作品ですか」と聞くと、この最も目立つ情報が判断を引っ張ります。加えて、問いの中に「日本の作品」という語が入っている時点で、答えは肯定側へ傾きます。否定するには、肯定を退ける根拠を自分で見つけてこなければならないからです。見つからなければ、肯定の方が返しやすい。

私はここで、二つの間違いを同時に犯していました。判断材料として不適切なものを主役に据えたことと、答えを含んだ問いを投げたことです。

判定に使えるのは、紙に刻まれている痕跡だけです

素材を何十点も見ているうちに、実際に効いている手がかりは限られていると分かってきました。整理すると次のようになります。

痕跡示すもの読み取りの注意
ひらがな・変体仮名日本の作品であることをほぼ確定させる題簽や画中の詞書に出る。崩し字なので判読より存在の確認が先
版元印・改印日本の出版流通を経た版画であること余白の端に小さく入る。トリミングされた素材では失われやすい
落款・絵師印絵師の特定につながる四隅のいずれか。部分拡大の素材には写っていないことがある
漢字のみの題跋が長い中国の作品を疑う単独では決め手にならない。日本の作品にも漢文の賛はある
大きな朱印が複数中国の作品を疑う鑑蔵印が重なる形。日本の版画の印とは大きさの桁が違う
細密な植物図と学名表記西洋のボタニカルアート浮世絵の素材集に紛れることが実際にある

この表の右列が示しているとおり、どの痕跡も単独では決め手になりません。決め手になるのは、日本側の痕跡が一つでも確認できたときだけです。中国側の特徴は「疑う」で止まり、確定には使えません。

非対称なのです。この非対称性を、後述する判断の表にそのまま持ち込みます。

ここまでお読みいただきありがとうございます。

この記事の続きを読む

この先には、実装コードやベンチマーク結果など、実務でお役に立てる内容をご用意しています。このサイトは広告を掲載しておらず、サーバーや開発にかかる費用はメンバーの皆様のご支援で成り立っています。もしお役に立てていましたら、ご支援いただけますと大変ありがたいです。

この記事で得られること
画像から属性を当てさせる分類器を、見えた証拠だけを列挙させる観察器へ組み替える判断ができるようになります
モデルが自信を持って外す入力を公開前に選り分けられるようになり、配信してから取り下げる手戻りを未然に防げます
信頼度スコアに頼らずに保留の線を引く方法が分かり、しきい値の調整に費やす時間を丸ごと省けるようになります
Stripe による安全な決済 · いつでもキャンセル可能

この記事を購入する

この先の内容をすべてお読みいただけます。一度のご購入で、いつでも何度でもアクセスできます。このサイトは広告を掲載しておらず、皆さまのご支援がサーバー費用などの運営を支えています。

または
メンバーシップなら全記事が読み放題 →
シェア

お読みいただきありがとうございます

Gemini Lab は広告なしで運営しており、サーバー費用などの運営コストはメンバーシップのご支援で賄っています。実装コード・ベンチマーク・本番設計パターンなど、実務でお役立ていただける記事を毎日更新しています。もし読んでよかったと感じていただけましたら、ぜひご覧ください。

  • コピー&ペーストで使える実装コード付き
  • 毎日新しい上級ガイドを追加
  • ¥580/月 または ¥2,480 の永久アクセス
メンバーシップを見る →

関連記事

高度な活用2026-08-25
AI 検索が広げたクエリを分母から外して、実質 CTR を出し直します
運営サイトの検索データで、表示回数上位5件のクリックが全て0でした。うち4件は人間が打つ語ではありません。分母を作り直す手順と、Gemini に判定を任せる境界の引き方をまとめます。
高度な活用2026-06-14
Gemini の構造化出力を本番で信用するために — スキーマ設計・二重検証・抑制つきリトライの実装メモ
Gemini の構造化出力は「パースできるJSON」は保証しても「正しい値」までは保証しません。@google/genai での新しいスキーマ設計、propertyOrdering の効き目、Zod による二重検証、MAX_TOKENS 切れの扱い、抑制つきリトライの実装をまとめました。
高度な活用2026-07-12
待ち時間を守りながら難問だけ深く考えさせる — Gemini の thinking_level をリクエストごとに振り分ける
アプリの AI 機能を全リクエスト high で回すと待ち時間と料金が膨らみ、全部 low にすると難問で精度が落ちます。Gemini 3.x の thinking_level をリクエストの難易度で振り分け、モバイルの待ち時間予算を守りながら深い推論を必要な場面だけに回すルーターを、実測値と動くコードで設計します。
📚RECOMMENDED BOOKS
大規模言語モデル入門
山田育矢
LLM開発
生成AIプロンプトエンジニアリング入門
我妻幸長
プロンプト
Claude CodeによるAI駆動開発入門
平川知秀
AI駆動開発
※ アフィリエイトリンクを含みます