Gemini 2.5 Flash Image 生成と編集の公式ガイダンス
Gemini 2.5 Flash Imageの画像生成能力をマスターすることは、基本原則から始まります:
シーンを描写し、キーワードを列挙しない。
モデルの核心的な優位性は、その深い言語理解能力にあります。物語的で記述的な段落は、ほとんど常に一連のつながりのない単語よりも高品質で一貫性のある画像を生成します。
画像生成のプロンプト (Prompts for Generating Images)
以下の戦略は、期待する正確な画像を生成するための効果的なプロンプトを作成するのに役立ちます。
1. 写真のようなリアルなシーンを作成 (Photorealistic Scenes)
リアルな画像を得るには、写真用語を使用してください。カメラアングル、レンズタイプ、照明、細かいディテールを明確に言及することで、モデルを写真のようにリアルな結果に導くことができます。
プロンプトテンプレート:
年老いた日本の陶芸家の写実的なクローズアップポートレート...アップロードした写真を白黒ポートレートアート作品に生成...背景は柔らかなグラデーション効果を呈し...繊細なフィルム粒子感...
2. スタイル化されたイラストとステッカーを生成 (Stylized Illustrations & Stickers)
ステッカー、アイコン、またはデザインアセットを作成するには、スタイルを明確に述べ、透明な背景を要求してください。
プロンプトテンプレート:
かわいいスタイルのステッカー、主役は幸せな小さなパンダ...写真の人物に基づいて、4コマアバターステッカーを生成、各アバターステッカーは異なる表情とアクションを持つ...
3. 画像内に正確なテキストを生成 (Accurate Text in Images)
Geminiはテキストのレンダリングが得意です。テキスト内容、フォントスタイル(記述的な言葉を使用可能)、全体的なデザインを明確に述べてください。
プロンプトテンプレート:
"The Daily Grind"という名前のコーヒーショップのための現代的でミニマリストなロゴを作成...注意:現在、モデルは英語文字のサポート効果が良好ですが、日本語文字の生成はまだ弱点で、エラーが発生したり効果が不十分な可能性があります。
4. 製品モックアップと商業写真をデザイン (Product Mockups & Commercial Photography)
この機能は、EC、広告、またはブランドのための清潔でプロフェッショナルな製品写真を作成するのに非常に適しています。
プロンプトテンプレート:
高解像度、スタジオ照明下の製品写真、主体はミニマリストなセラミックコーヒーカップ...この手描きスケッチに基づいて、3つのコンセプトレンダリング図を生成:1. ミニマリストな白いデザイン... 2. スポーティなネオングリーン... 3. 高級ライフスタイル版...
5. ミニマリストとネガティブスペースデザインを構築 (Minimalist & Negative Space Design)
ウェブサイト、プレゼンテーション、またはテキストをオーバーレイする必要があるマーケティング資料の背景を作成するのに適しています。
プロンプトテンプレート:
ミニマリストな構図、主体は精巧な赤いカエデの葉...残りの部分は大きなネガティブスペースでミニマリストに保ち、画面が自由に呼吸できるようにします...
6. 連続性のあるアート(漫画/ストーリーボード)を作成
キャラクターの一貫性とシーンの記述に基づいて、視覚的な物語のためのボードを作成します。
プロンプトテンプレート:
強靭な、ブラックアートスタイルの単一漫画ボード...画像内容に基づいて9コマ漫画を生成、画面とカメラで物語を語る。
画像編集のプロンプト (Prompts for Editing Images)
以下の例は、編集、合成、スタイル転送のためにテキストプロンプトで画像を提供する方法を示しています。
1. 要素の追加と削除 (Adding and Removing Elements)
画像を提供し、変更を説明してください。モデルは元の画像のスタイル、照明、視点に合わせます。
プロンプトテンプレート:
画像の左側のバイクに乗っている人とバイクを削除。人物の横に小さな猫を追加し、比率を合理的にします。
2. 局所修復 (Inpainting / Semantic Masking)
対話的な指示で「マスク」を定義して画像の特定の部分を編集し、残りの部分はそのままにします。これは赤枠またはマスクで実現できます。
プロンプトテンプレート:
赤いボックス内の人物を分離して、高解像度の単独写真にします。replace the brush area with a chanel bag (マスク領域をシャネルのバッグに置き換える)。
3. スタイル転送 (Style Transfer)
画像を提供し、モデルに異なる芸術スタイルでそのコンテンツを再作成するよう要求してください。
プロンプトテンプレート:
ゴッホの星空スタイルの油絵に変換。画像内の人物を3Dスタイルに変換。
4. 高度な構図:複数画像の組み合わせ (Advanced Composition: Combining Multiple Images)
複数の画像をコンテキストとして提供し、全く新しい合成シーンを作成します。これは製品モックアップやクリエイティブコラージュに非常に効果的です。
プロンプトテンプレート:
図1の人物に図2のキャラクターをコスプレさせて、衣装、メイク、小道具を図2と一致させます。図1のモデルに図2の服を着せてネックレスを付けます。
5. 高忠実度ディテール保持 (High-Fidelity Detail Preservation)
編集中に顔やロゴなどの重要なディテールが保持されるようにするには、編集リクエストで詳細に記述してください。
プロンプトテンプレート:
そのキャラクターの造形を完全に変更せず、カフェに配置します。
ベストプラクティス (Best Practices)
これらのプロフェッショナルな戦略をワークフローに組み込むことで、結果を「優秀」から「卓越」に向上させることができます。
- 指示を極めて具体的に (Be Hyper-Specific): 提供するディテールが多いほど、コントロールが強くなります。「未来的な鎧」と言うのではなく、「銀色の葉模様が刻まれた華麗なエルフの板金鎧、高い襟と隼の翼のような肩当てを持つ」と記述してください。
- 意図とコンテキストを提供 (Provide Context and Intent): 画像の用途を説明することで、モデルがニーズをよりよく理解するのに役立ちます。例えば、「高級でミニマリストなスキンケアブランドのロゴを作成」は「ロゴを作成」よりも良い結果を得られます。
- 反復と最適化 (Iterate and Refine): 一度で完璧な画像を期待しないでください。モデルの対話特性を利用して微調整します。例えば、追加質問:「良いですね。でも光をもう少し暖かくできますか?」
- 段階的指示を使用 (Use Step-by-Step Instructions): 複数の要素を含む複雑なシーンの場合、プロンプトを複数のステップに分解してください。例えば:「まず、静かな森の背景を作成。次に、前景に石の祭壇を追加。最後に、祭壇の上に光る剣を配置。」
- 「セマンティック逆プロンプト」を活用 (Use "Semantic Negative Prompts"): 否定語(例:「車なし」)を使用するのではなく、望むシーンを肯定的に記述してください:「広々とした荒涼とした道路、交通の痕跡が全くない。」
- カメラをコントロール (Control the Camera): 写真と映画の用語を使用して構図をコントロールします。例:
広角ショット(wide-angle shot)、マクロ撮影(macro shot)、Gobo投影照明(gobo lighting)など。
制限事項 (Limitations)
- モデルは指定された数の画像を生成する際、ユーザーの明確な要求に常に正確に従うとは限りません。
- 入力として、モデルは最大3枚の画像を処理する際に最適な効果を発揮します。
- EEA、CH、UK地域では、現在子供の写真のアップロードはサポートされていません。
- すべての生成された画像にはSynthID透かしが含まれます。