纳米香蕉:它是什么以及谷歌的模型如何运作

最后更新: 28月2025
  • Google 确认“Nano Banana”是用于图像生成和编辑的 Gemini 2.5 Flash Image 的别名。
  • 对话式编辑,人物、物体连贯,结果一致。
  • 可在 Gemini 应用程序中免费使用,也可通过 API、AI Studio 和 Vertex AI 供开发人员使用。
  • 使用 SynthID 和敏感内容过滤器增强安全性。

用于图像编辑和生成的AI模型

近日,“Nano Banana”这个名字在技术论坛和网络上迅速传播开来,因为它在人工智能驱动的图像编辑测试中表现出色。这个名字的由来如今已揭晓:它出自谷歌及其集成到Gemini中的全新图像引擎。

该公司证实,Nano Banana 是Gemini 2.5 Flash Image的别名,该系统能够使用自然语言生成和修饰照片,保持风格、人物和对象的一致性,而这对于这些模型来说以前是很难做到的。

什么是 Nano Banana?它的幕后推手是谁?

该模型早期亮相时,曾以“纳米香蕉”的昵称出现在 LM Arena 排行榜上,引发了各种猜测和“香蕉”笑话,直到谷歌正式将其作为 Gemini 的一部分引入。其核心理念很明确:将图像生成和编辑统一到一个简单、对话式且快速的工作流程中。

谷歌强调,其方法依赖于Gemini 对世界的了解先进的 AI 模型,这有助于理解指令的上下文,并应用比纯粹视觉生成器更精确的更改。

Gemini 中的 AI 图像编辑

对话编辑:从提示到微调

该模型使用自然语言命令,并允许您与图像进行交互:您可以要求“让天空更具戏剧性”、“移除那个标志”或“将汽车颜色改为红色”,并在连续几轮中不断改进结果,而无需从头开始。

这种多步骤交互方式减少了传统工具常见的操作阻力。据谷歌称,用户可以选择特定区域来调整颜色、光照或纹理,移除不需要的元素,替换背景,以及添加能够无缝融合并兼顾阴影和透视效果的对象。

  使用 n8n 连接物联网传感器的完整指南

除了基本的修图功能外,该平台还能理解“将同一角色放置到另一个场景中”或“从不同角度展示产品”等指令,从而在编辑过程中保持主体及其外观的一致性

一致性、质量和速度

其中一项突出的进步是提高了连续版本之间的视觉一致性:面部特征、手部、宠物和物体保持稳定,失真较小,这在历史上一直是生成模型面临的一个问题。

通过更自然的光照和纹理增强照片级真实感,谷歌声称其闪电般的速度可以加快产品变体或主题场景等任务的创作周期。

在社区测试中,该系统在 LM Arena 图像编辑排名中不断攀升,根据用户评分,其用户体验已跻身最佳引擎之列。

主要工具和用例

Gemini 2.5 Flash Image 包含专为普通用户和创意团队设计的各项功能。其中一些最引人注目的功能允许您将来自多个来源的图像合成,并将它们置于一个协调统一的环境中。

  • 上下文修饰: 颜色、曝光、纹理或样式调整,而不会丢失原始图像的关键元素。
  • 拆卸和更换: 擦除对象、更改背景或添加具有光影融合的元素。
  • 成分和混合物: 将两张照片合并为一个场景并传输 图案或风格 从一个图像到另一个图像。
  • 多班次版本: 链式变更(粉刷墙壁、添加家具、改造衣柜),无需重新开始整个过程​​。

在市场营销、装饰、时尚或社交媒体内容中,该工具用于快速创建变体、保持一致的品牌资源以及测试视觉创意,而无需借助传统软件。

安全和使用限制

为了最大限度地减少滥用行为,谷歌应用了过滤器来屏蔽暴力或色情内容,并限制对真实人物或公众人物的编辑。其目的是降低虚假信息和深度伪造技术传播的风险。

  Dall-e 人工智能:图像创建

所有生成或编辑的图像都包含SynthID,这是一种嵌入文件内部的、不易察觉的数字水印,有助于验证图像来源。此外,该公司还提到其他信号和主动控制措施,以加强可追溯性。

该使用政策明确禁止在未经同意的情况下创建私密材料和其他敏感类别的内容,这体现了Gemini 服务对负责任的 AI的重视。

如何在 Gemini 应用程序中使用 Nano Banana

使用方法非常简单:无需安装任何额外软件或选择特定型号。只需打开 Gemini,上传照片,并描述修改内容即可。如果您只想保留一项调整,可以在开头写上“在原图中,……”,以明确说明其余部分需要保留。

一些实用示例:“转换为黑白”、“移除角落的柱子”、“在长椅上添加一只狗”或“将裙子颜色改为绿色”。系统会在应用更改时尽量保持人物的特征和比例。

您还可以上传两张照片,并要求将其中一张照片的内容显示在另一张照片中,或者将图案的样式(例如蝴蝶翅膀)转移到第二张照片中的服装或物品上。

开发人员的可用性和访问权限

该功能已在面向公众的Gemini 应用中提供。对于专业集成,可通过 Gemini API、 Google AI Studio和 Vertex AI 访问,从而为企业工作流程和第三方应用打开大门。

应用内使用免费,但有合理的限制。对于开发者,Google 提供按需付费的定价模式;API 中提到的参考价格为每百万个代币 30 美元,根据具体使用情况,每张图片的价格约为几美分。

  谷歌推出 Gemma 3:针对单个 GPU 优化的全新开放式 AI

竞争环境

此举直接针对Midjourney 和 DALL·E (OpenAI) 等竞争对手。谷歌的战略重点在于对话式编辑和一致的结果,并由 Gemini 的上下文理解能力提供支持。

随着 Nano Banana 这个别名被整合到其生态系统中,该公司正试图缩小在速度、质量和控制对最终用户至关重要的领域中的差距。

常见问题

Nano Banana 是一款独立的应用程序吗?

不,它是 Gemini 内部的一个模型,因此是通过应用程序自身的界面使用的。

最终用户需要付费吗?

Gemini 应用提供免费使用,但有使用次数限制。API 集成则会产生费用。

我必须手动选择模型吗?

不,在 Gemini 中执行图像生成或编辑功能时,会自动进行选择。

Nano Banana(Gemini 2.5 Flash Image)专注于对话式编辑、拍摄对象一致性以及内置安全措施,无论是通过 Gemini 应用程序还是通过其 API,它都将成为日常生活和专业项目中创建和修饰图像的可靠选择。

梦想工作室
相关文章:
DreamStudio:它是什么以及如何利用人工智能创建图像