Nano Banana: què és i com funciona el model de Google

Darrera actualització: 28 d'agost de 2025
  • Google confirma que "Nano Banana" és l'àlies de Gemini 2.5 Flash Image per a generació i edició d'imatges.
  • Edició conversacional amb coherència de personatges i objectes i resultats consistents.
  • Disponible gratis a l'app de Gemini i per a desenvolupadors via API, AI Studio i Vertex AI.
  • Reforços de seguretat amb SynthID i filtres per a contingut sensible.

Model d'IA per a edició i generació d'imatges

En els darrers dies, el nom Nano Banana ha corregut com la pólvora en fòrums i xarxes tècniques pel seu exercici en proves d'edició visual amb IA. El que semblava un misteri ja té autoria: darrere hi ha Google i el seu nou motor d'imatges integrat a Gemini.

La companyia confirma que Nano Banana és l'àlies de Gemini 2.5 Flash Image , un sistema capaç de generar i retocar fotografies mitjançant llenguatge natural, mantenint estil, personatges i objectes amb una consistència que fins ara era complicada per a aquests models.

Què és Nano Banana i qui hi ha al darrere?

Durant les seves primeres aparicions, el model es va deixar veure en rànquings de LM Arena sota el sobrenom «Nano Banana», generant especulacions i bromes «bananeres» fins que Google el va presentar oficialment com a part de Gemini. La idea de fons és clara: unificar generació i edició d‟imatges en un flux simple, conversacional i ràpid.

Google recalca que el seu enfocament es recolza en el coneixement del món de Gemini i en models d'IA avançats , cosa que ajuda a entendre el context de les instruccions ia aplicar canvis més precisos que els de generadors purament visuals.

Edició d'imatges amb IA a Gemini

Edició conversacional: del prompt al retoc fi

El model funciona amb ordres en llenguatge natural i permet dialogar amb la imatge: es pot demanar "fes el cel més dramàtic", "elimina aquest cartell" o "canvia el color del cotxe a vermell" i refinar el resultat en successives rondes sense començar de zero.

Aquesta interacció multi-torn redueix la fricció típica de les eines clàssiques. Segons Google, és possible seleccionar zones concretes per ajustar color, il·luminació o textura, eliminar elements no desitjats, substituir fons i afegir objectes que s'hi integrin respectant ombres i perspectiva.

  Com personalitzar ChatGPT i afinar les respostes com un expert

A més dels retocs bàsics, la plataforma entén indicacions com «col·loca el mateix personatge en una altra escena» o «mostra el producte des de diversos angles», conservant el subjecte i la seva aparença amb consistència entre edicions.

Coherència, qualitat i velocitat

Un dels avenços destacats és la millora de la coherència visual en edicions successives: trets facials, mans, mascotes o objectes es mantenen estables amb menys deformacions, cosa que històricament posava en dificultats els models generatius.

El fotorealisme guanya sencers amb il·luminació i textures més naturals, i Google afirma un rendiment molt ràpid (lightning fast) que accelera cicles creatius per a tasques com ara variacions de producte o escenes temàtiques.

En proves comunitàries, el sistema ha escalat posicions a LM Arena per a edició d'imatges, situant-se entre els motors amb millor experiència d'ús segons les valoracions d'usuaris.

Eines i casos d'ús principals

Gemini 2.5 Flash Image agrupa funcions pensades tant per a usuaris generals com per a equips creatius. Algunes de les més vistoses permeten compondre imatges a partir de diverses fonts i situar-les en un entorn coherent.

  • Retoc contextual: ajustaments de color, exposició, textura o estil sense perdre elements clau de l'original.
  • Eliminació i substitució: esborrar objectes, canviar fons o afegir elements amb integració de llum i ombres.
  • Composició i barreja: combinar dues fotos en una sola escena i transferir patrons o estils duna imatge a una altra.
  • Edició multi-torn: encadenar canvis (pintar parets, afegir mobles, modificar vestuari) sense reiniciar el procés.

En màrqueting, decoració, moda o continguts per a xarxes, l'eina serveix per crear variants amb rapidesa, mantenir recursos de marca consistents i provar idees visuals sense anar a programari tradicional.

Seguretat i límits dús

Per minimitzar l'abús, Google aplica filtres que bloquegen contingut violent o sexualment explícit i restringeix l'edició de persones reals o figures públiques. L'objectiu és reduir els riscos de desinformació i deepfakes.

  Guia Completa sobre Processament GPU a Temps Reial i per Lots

Totes les imatges generades o editades incorporen SynthID , una marca d'aigua digital imperceptible al mateix fitxer que ajuda a verificar l'origen. Amb això, la companyia parla de senyals addicionals i controls proactius per reforçar la traçabilitat.

La política dús prohibeix expressament la creació de material íntim sense consentiment i altres categories sensibles, reforçant lenfocament de IA responsable en els serveis de Gemini.

Com utilitzar Nano Banana a l'app de Gemini

L'accés és directe: no cal instal·lar res a part ni triar un model específic. Només cal obrir Gemini, pujar una foto i descriure els canvis . Si vols conservar-ho tot menys un ajustament, pots començar amb «A la foto original, …» per deixar clar que ha de respectar la resta.

Alguns exemples útils: «converteix blanc i negre», «elimina el pal de la cantonada», «afegeix un gos al banc» o «canvia el vestit de color verd». El sistema intenta mantenir trets i proporcions del subjecte mentre aplica el canvi.

També podeu pujar dues fotos i demanar que el contingut d'una aparegui a l'altra, o que transfereixi l' estil d'un patró (per exemple, ales de papallona) a una peça o objecte de la segona imatge.

Disponibilitat i accés per a desenvolupadors

La funcionalitat està disponible a l' app de Gemini per al públic general. Per a integracions professionals, es pot accedir mitjançant l'API de Gemini, Google AI Studio i Vertex AI, obrint la porta a fluxos de treball a empreses i apps de tercers.

L'ús a l'aplicació és gratuït amb límits raonables. Per a desenvolupadors, Google ofereix tarifació per ús ; s'esmenta un cost de 30 dòlars per milió de tokens com a referència a l'API, amb estimacions aproximades que situen cada imatge a cèntims d'euro, segons el cas d'ús.

  Com utilitzar Google Gemini a la vida diària per ser més productiu

Context competitiu

El moviment apunta directament rivals com Midjourney o DALL·E (OpenAI). L'aposta de Google és a l'edició conversacional i la coherència de resultats, recolzades per l'entesa contextual de Gemini.

Amb l'àlies Nano Banana ja integrat al seu ecosistema, la companyia intenta tancar la bretxa en un terreny on velocitat, qualitat i control són decisius per a l'usuari final.

Preguntes freqüents

És Nano Banana una aplicació independent?

No. És un model dins de Gemini , així que s'utilitza des de la pròpia interfície de l'app.

Té cost per a usuaris finals?

A l'aplicació de Gemini es pot fer servir de forma gratuïta amb límits d'ús. Les integracions per API sí que tenen tarifació.

Cal seleccionar el model manualment?

No. La selecció és automàtica quan feu funcions de generació o edició d'imatges a Gemini.

Amb un enfocament centrat en l'edició per conversa, la coherència de subjectes entre preses i mesures de seguretat integrades, Nano Banana (Gemini 2.5 Flash Image) es perfila com una opció sòlida per crear i retocar imatges tant al dia a dia com a projectes professionals, ja sigui des de l'app de Gemini o mitjançant les seves APIs.

estudi dels somnis
Article relacionat:
DreamStudio: què és i com crear imatges amb intel·ligència artificial