Gemini 2.5 Flash Image 生成与编辑官方指引
掌握 Gemini 2.5 Flash Image 的图像生成能力,始于一个基本原则:
描述场景,而非罗列关键词。
模型的核心优势在于其深度语言理解能力。一个叙事性的、描述性的段落几乎总能比一堆不连贯的词语产生更优质、更连贯的图像。
图像生成提示词 (Prompts for Generating Images)
以下策略将帮助您创建有效的提示词,以生成您所期望的精确图像。
1. 创造照片级真实感场景 (Photorealistic Scenes)
为了获得逼真的图像,请使用摄影术语。明确提及相机角度、镜头类型、光线和精细细节,可以引导模型产出照片级真实感的结果。
提示词模板:
一张富有真实感的特写肖像,主角是一位年迈的日本陶艺家...将上传的照片生成黑白肖像艺术作品...背景呈现柔和渐变效果...细腻的胶片颗粒质感...
2. 生成风格化插图与贴纸 (Stylized Illustrations & Stickers)
要创建贴纸、图标或设计资产,请明确说明风格并要求透明背景。
提示词模板:
一张卡哇伊风格的贴纸,主角是一只快乐的小熊猫...根据照片上的人物,生成一张 4 宫格头像贴,每张头像贴都要有不同的表情和动作...
3. 在图像中生成精确文本 (Accurate Text in Images)
Gemini 擅长渲染文本。请清晰地说明文本内容、字体风格(可用描述性词语)和整体设计。
提示词模板:
为一家名为“The Daily Grind”的咖啡店创建一个现代、极简的logo...注意:目前模型对英文字符的支持效果较好,中文字符的生成仍是其短板,可能会出错或效果不佳。
4. 设计产品模型与商业摄影 (Product Mockups & Commercial Photography)
此功能非常适合为电商、广告或品牌创建干净、专业的产品照片。
提示词模板:
一张高分辨率、影棚光线下的产品照片,主体是一个极简主义的陶瓷咖啡杯...根据这张手绘草图,生成3个概念渲染图:1. 极简白设计... 2. 运动霓虹绿... 3. 高端生活方式版...
5. 构建极简与留白设计 (Minimalist & Negative Space Design)
适用于为网站、演示文稿或需要叠加文字的营销材料创建背景。
提示词模板:
一个极简主义的构图,主体是一片精致的红色枫叶...其余部分以大面积负空间保持极简,使画面自由呼吸...
6. 创作连续性艺术(漫画/故事板)
基于角色一致性和场景描述,为视觉叙事创建画板。
提示词模板:
一个坚韧、黑色艺术风格的单幅漫画画板...根据图片内容生成九格漫画,用画面和镜头讲故事。
图像编辑提示词 (Prompts for Editing Images)
以下示例展示了如何在文本提示词中提供图像,以进行编辑、合成和风格转换。
1. 添加与移除元素 (Adding and Removing Elements)
提供一张图片并描述您的改动。模型将匹配原始图像的风格、光线和视角。
提示词模板:
去掉图片左边骑着摩托的人和摩托车。添加一只小猫蹲在人物旁边,比例合理。
2. 局部修复 (Inpainting / Semantic Masking)
通过对话式指令定义一个“蒙版”来编辑图像的特定部分,同时保持其余部分不变。这可以通过红框或蒙版实现。
提示词模板:
将红色盒子中的人分离,变成高清单人照片。replace the brush area with a chanel bag (将蒙版区域替换为一个香奈儿包)。
3. 风格转换 (Style Transfer)
提供一张图片,并要求模型以不同的艺术风格重新创作其内容。
提示词模板:
转换为梵高星空风格油画。将图片中的人物转变为3D风格。
4. 高级构图:融合多张图像 (Advanced Composition: Combining Multiple Images)
提供多张图片作为上下文,以创建一个全新的合成场景。这对于产品模型或创意拼贴非常有效。
提示词模板:
让图一的人物cosplay图二的角色,服饰、妆容、道具和图二一致。图一模特穿上图二的衣服并佩戴项链。
5. 保持高保真细节 (High-Fidelity Detail Preservation)
为确保关键细节(如面部或Logo)在编辑过程中得以保留,请在编辑请求中详细描述它们。
提示词模板:
保持该角色的造型完全不变,将其放置在一家咖啡馆中。
最佳实践 (Best Practices)
将这些专业策略融入您的工作流,可以使结果从“优秀”提升至“卓越”。
- 指令要极度具体 (Be Hyper-Specific): 您提供的细节越多,控制力就越强。与其说“未来感盔甲”,不如描述:“一套华丽的精灵板甲,蚀刻着银色叶片图案,拥有高领和形如隼翼的肩甲。”。
- 提供意图与上下文 (Provide Context and Intent): 解释图片的用途能帮助模型更好地理解您的需求。例如,“为一个高端、简约护肤品牌创建一个logo”会比“创建一个logo”得到更好的结果。
- 迭代与优化 (Iterate and Refine): 不要期望一次性获得完美图像。利用模型的对话特性进行微调,例如追问:“很好,但能让光线更暖一些吗?”。
- 使用分步指令 (Use Step-by-Step Instructions): 对于包含多个元素的复杂场景,将您的提示词分解为多个步骤。例如:“首先,创建一个宁静的森林背景。然后,在前景加入一座石坛。最后,在祭坛上放置一把发光的剑。”。
- 善用“语义反向提示” (Use "Semantic Negative Prompts"): 与其使用否定词(如“不要有车”),不如正面描述您想要的场景:“一条空旷、荒芜的街道,没有任何交通的迹象。”。
- 控制相机 (Control the Camera): 使用摄影和电影术语来控制构图,如
广角镜头(wide-angle shot)、微距拍摄(macro shot)、Gobo光影投射(gobo lighting)等。
局限性 (Limitations)
- 模型在生成指定数量的图像方面,不总能精确遵循用户的明确要求。
- 作为输入,模型在处理最多3张图片时效果最佳。
- 在EEA、CH和UK地区,目前不支持上传儿童照片。
- 所有生成的图像都包含 SynthID 水印。