納米香蕉:它是什麼以及谷歌的模型如何運作

最後更新: 28月2025
  • Google 確認「Nano Banana」是用於影像產生和編輯的 Gemini 2.5 Flash Image 的別名。
  • 對話式編輯,人物、物件連貫,結果一致。
  • 可在 Gemini 應用程式中免費使用,也可透過 API、AI Studio 和 Vertex AI 供開發人員使用。
  • 使用 SynthID 和敏感內容過濾器增強安全性。

用於影像編輯和生成的AI模型

近日,「Nano Banana」這個名字在技術論壇和網路上迅速傳播開來,因為它在人工智慧驅動的圖像編輯測試中表現出色。這個名字的由來如今已揭曉:它出自Google及其整合到Gemini中的全新影像引擎。

該公司證實,Nano Banana 是Gemini 2.5 Flash Image的別名,該系統能夠使用自然語言生成和修飾照片,保持風格、人物和物體的一致性,而這對於這些模型來說以前是很難做到的。

什麼是 Nano Banana?它的幕後推手是誰?

該模型早期亮相時,曾以“納米香蕉”的暱稱出現在 LM Arena 排行榜上,引發了各種猜測和“香蕉”笑話,直到谷歌正式將其作為 Gemini 的一部分引入。其核心理念很明確:將圖像生成和編輯統一到一個簡單、對話式且快速的工作流程中。

谷歌強調,其方法依賴Gemini 對世界的了解先進的 AI 模型,有助於理解指令的上下文,並應用比純粹視覺生成器更精確的變更。

Gemini 中的 AI 影像編輯

對話編輯:從提示到微調

該模型使用自然語言命令,並允許您與圖像進行互動:您可以要求“讓天空更具戲劇性”、“移除那個標誌”或“將汽車顏色改為紅色”,並在連續幾輪中不斷改進結果,而無需從頭開始。

這種多步驟互動方式減少了傳統工具常見的操作阻力。據Google稱,用戶可以選擇特定區域來調整顏色、光線或紋理,移除不需要的元素,替換背景,以及添加能夠無縫融合並兼顧陰影和透視效果的物件。

  使用 n8n 連接物聯網感測器的完整指南

除了基本的修圖功能外,該平台還能理解「將相同角色放置到另一個場景中」或「從不同角度展示產品」等指令,從而在編輯過程中保持主體及其外觀的一致性

一致性、品質和速度

其中一個突出的進步是提高了連續版本之間的視覺一致性:面部特徵、手部、寵物或物體保持穩定,失真較小,這在歷史上一直是生成模型的難題。

透過更自然的光線和紋理增強照片級真實感,Google聲稱其閃電般的速度可以加快產品變體或主題場景等任務的創作週期。

在社群測試中,該系統在 LM Arena 圖像編輯排名中不斷攀升,根據用戶評分,其用戶體驗已躋身最佳引擎之列。

主要工具和用例

Gemini 2.5 Flash Image 包含專為一般使用者和創意團隊設計的各項功能。其中一些最引人注目的功能可讓您將來自多個來源的影像合成,並將它們置於一個協調統一的環境中。

  • 上下文修飾: 顏色、曝光、紋理或樣式調整,而不會失去原始影像的關鍵元素。
  • 拆卸與更換: 擦除物件、更改背景或添加具有光影融合的元素。
  • 成分和混合物: 將兩張照片合併為一個場景並傳輸 圖案或風格 從一個圖像到另一個圖像。
  • 多班次版本: 鍊式變更(粉刷牆壁、添加家具、改造衣櫃),無需重新開始整個過程。

在行銷、裝飾、時尚或社交媒體內容中,該工具用於快速創建變體、保持一致的品牌資源以及測試視覺創意,而無需借助傳統軟體。

安全和使用限制

為了最大限度地減少濫用行為,谷歌應用了過濾器來屏蔽暴力或色情內容,並限制對真實人物或公眾人物的編輯。其目的是降低虛假資訊和深度偽造技術傳播的風險。

  Dall-e 人工智慧:影像創建

所有產生或編輯的影像都包含SynthID,這是一種嵌入文件內部的、不易察覺的數位浮水印,有助於驗證影像來源。此外,該公司還提到其他訊號和主動控制措施,以加強可追溯性。

這項使用政策明確禁止在未經同意的情況下創建私密材料和其他敏感類別的內容,這體現了Gemini 服務對負責任的 AI的重視。

如何在 Gemini 應用程式中使用 Nano Banana

使用方法非常簡單:無需安裝任何額外軟體或選擇特定型號。只需打開 Gemini,上傳照片,並描述修改內容即可。如果您只想保留一項調整,可以在開頭寫上“在原圖中,…”,以明確說明其餘部分需要保留。

一些實用範例:「轉換為黑白」、「移除角落的柱子」、「在長椅上添加一隻狗」或「將裙子顏色改為綠色」。系統會在套用變更時盡量保持人物的特徵和比例。

您也可以上傳兩張照片,並要求將其中一張照片的內容顯示在另一張照片中,或將圖案的樣式(例如蝴蝶翅膀)轉移到第二張照片中的服裝或物品上。

開發人員的可用性和存取權限

此功能已在面向大眾的Gemini 應用中提供。對於專業集成,可透過 Gemini API、 Google AI Studio和 Vertex AI 訪問,從而為企業工作流程和第三方應用程式打開大門。

應用程式內使用免費,但有合理的限制。對於開發者,Google 提供按需付費的定價模式;API 中提到的參考價格為每百萬個代幣 30 美元,根據具體使用情況,每張圖片的價格約為幾美分。

  Google推出 Gemma 3:針對單一 GPU 最佳化的全新開放式 AI

競爭環境

此舉直接針對Midjourney 和 DALL·E (OpenAI) 等競爭對手。谷歌的策略重點在於對話式編輯和一致的結果,並由 Gemini 的上下文理解能力提供支援。

隨著 Nano Banana 這個別名被整合到其生態系統中,該公司正試圖縮小在速度、品質和控制對最終用戶至關重要的領域中的差距。

Preguntas frecuentes

Nano Banana 是一款獨立的應用程式嗎?

不,它是 Gemini 內部的一個模型,因此是透過應用程式本身的介面使用的。

最終用戶需要付費嗎?

Gemini 應用程式提供免費使用,但有使用次數限制。 API 整合則會產生費用。

我必須手動選擇模型嗎?

不,在 Gemini 中執行影像產生或編輯功能時,會自動進行選擇。

Nano Banana(Gemini 2.5 Flash Image)專注於對話式編輯、主體一致性以及內建安全措施,無論是透過 Gemini 應用程式還是透過其 API,它都將成為日常生活和專業專案中創建和修飾影像的可靠選擇。

夢想工作室
相關文章:
DreamStudio:它是什麼以及如何利用人工智慧創建圖像