Gemini 2.5 Flash Image 生成与编辑官方指引

掌握 Gemini 2.5 Flash Image 的图像生成能力,始于一个基本原则:

描述场景,而非罗列关键词。

模型的核心优势在于其深度语言理解能力。一个叙事性的、描述性的段落几乎总能比一堆不连贯的词语产生更优质、更连贯的图像。


图像生成提示词 (Prompts for Generating Images)

以下策略将帮助您创建有效的提示词,以生成您所期望的精确图像。

1. 创造照片级真实感场景 (Photorealistic Scenes)

为了获得逼真的图像,请使用摄影术语。明确提及相机角度、镜头类型、光线和精细细节,可以引导模型产出照片级真实感的结果。

提示词模板:
一张富有真实感的特写肖像,主角是一位年迈的日本陶艺家...
将上传的照片生成黑白肖像艺术作品...背景呈现柔和渐变效果...细腻的胶片颗粒质感...

2. 生成风格化插图与贴纸 (Stylized Illustrations & Stickers)

要创建贴纸、图标或设计资产,请明确说明风格并要求透明背景。

提示词模板:
一张卡哇伊风格的贴纸,主角是一只快乐的小熊猫...
根据照片上的人物,生成一张 4 宫格头像贴,每张头像贴都要有不同的表情和动作...

3. 在图像中生成精确文本 (Accurate Text in Images)

Gemini 擅长渲染文本。请清晰地说明文本内容、字体风格(可用描述性词语)和整体设计。

提示词模板:
为一家名为“The Daily Grind”的咖啡店创建一个现代、极简的logo...

注意:目前模型对英文字符的支持效果较好,中文字符的生成仍是其短板,可能会出错或效果不佳

4. 设计产品模型与商业摄影 (Product Mockups & Commercial Photography)

此功能非常适合为电商、广告或品牌创建干净、专业的产品照片。

提示词模板:
一张高分辨率、影棚光线下的产品照片,主体是一个极简主义的陶瓷咖啡杯...
根据这张手绘草图,生成3个概念渲染图:1. 极简白设计... 2. 运动霓虹绿... 3. 高端生活方式版...

5. 构建极简与留白设计 (Minimalist & Negative Space Design)

适用于为网站、演示文稿或需要叠加文字的营销材料创建背景。

提示词模板:
一个极简主义的构图,主体是一片精致的红色枫叶...
其余部分以大面积负空间保持极简,使画面自由呼吸...

6. 创作连续性艺术(漫画/故事板)

基于角色一致性和场景描述,为视觉叙事创建画板。

提示词模板:
一个坚韧、黑色艺术风格的单幅漫画画板...
根据图片内容生成九格漫画,用画面和镜头讲故事。


图像编辑提示词 (Prompts for Editing Images)

以下示例展示了如何在文本提示词中提供图像,以进行编辑、合成和风格转换。

1. 添加与移除元素 (Adding and Removing Elements)

提供一张图片并描述您的改动。模型将匹配原始图像的风格、光线和视角。

提示词模板:
去掉图片左边骑着摩托的人和摩托车。
添加一只小猫蹲在人物旁边,比例合理。

2. 局部修复 (Inpainting / Semantic Masking)

通过对话式指令定义一个“蒙版”来编辑图像的特定部分,同时保持其余部分不变。这可以通过红框蒙版实现。

提示词模板:
将红色盒子中的人分离,变成高清单人照片。
replace the brush area with a chanel bag (将蒙版区域替换为一个香奈儿包)。

3. 风格转换 (Style Transfer)

提供一张图片,并要求模型以不同的艺术风格重新创作其内容。

提示词模板:
转换为梵高星空风格油画。
将图片中的人物转变为3D风格。

4. 高级构图:融合多张图像 (Advanced Composition: Combining Multiple Images)

提供多张图片作为上下文,以创建一个全新的合成场景。这对于产品模型或创意拼贴非常有效。

提示词模板:
让图一的人物cosplay图二的角色,服饰、妆容、道具和图二一致。
图一模特穿上图二的衣服并佩戴项链。

5. 保持高保真细节 (High-Fidelity Detail Preservation)

为确保关键细节(如面部或Logo)在编辑过程中得以保留,请在编辑请求中详细描述它们。

提示词模板:
保持该角色的造型完全不变,将其放置在一家咖啡馆中。


最佳实践 (Best Practices)

将这些专业策略融入您的工作流,可以使结果从“优秀”提升至“卓越”。

  • 指令要极度具体 (Be Hyper-Specific): 您提供的细节越多,控制力就越强。与其说“未来感盔甲”,不如描述:“一套华丽的精灵板甲,蚀刻着银色叶片图案,拥有高领和形如隼翼的肩甲。”。
  • 提供意图与上下文 (Provide Context and Intent): 解释图片的用途能帮助模型更好地理解您的需求。例如,“为一个高端、简约护肤品牌创建一个logo”会比“创建一个logo”得到更好的结果。
  • 迭代与优化 (Iterate and Refine): 不要期望一次性获得完美图像。利用模型的对话特性进行微调,例如追问:“很好,但能让光线更暖一些吗?”。
  • 使用分步指令 (Use Step-by-Step Instructions): 对于包含多个元素的复杂场景,将您的提示词分解为多个步骤。例如:“首先,创建一个宁静的森林背景。然后,在前景加入一座石坛。最后,在祭坛上放置一把发光的剑。”。
  • 善用“语义反向提示” (Use "Semantic Negative Prompts"): 与其使用否定词(如“不要有车”),不如正面描述您想要的场景:“一条空旷、荒芜的街道,没有任何交通的迹象。”。
  • 控制相机 (Control the Camera): 使用摄影和电影术语来控制构图,如 广角镜头(wide-angle shot)微距拍摄(macro shot)Gobo光影投射(gobo lighting) 等。

局限性 (Limitations)

  • 模型在生成指定数量的图像方面,不总能精确遵循用户的明确要求。
  • 作为输入,模型在处理最多3张图片时效果最佳。
  • 在EEA、CH和UK地区,目前不支持上传儿童照片。
  • 所有生成的图像都包含 SynthID 水印。