Nano Banana: Nó là gì và mô hình của Google hoạt động như thế nào

Cập nhật lần cuối: 28 Tháng Tám 2025
  • Google xác nhận rằng "Nano Banana" là tên gọi khác của Gemini 2.5 Flash Image để tạo và chỉnh sửa hình ảnh.
  • Chỉnh sửa hội thoại với các nhân vật và đối tượng mạch lạc và kết quả nhất quán.
  • Có sẵn miễn phí trong ứng dụng Gemini và dành cho các nhà phát triển thông qua API, AI Studio và Vertex AI.
  • Tăng cường bảo mật với SynthID và bộ lọc nội dung nhạy cảm.

Mô hình AI để chỉnh sửa và tạo hình ảnh

Những ngày gần đây, cái tên "Nano Banana" đã lan truyền như cháy rừng trên các diễn đàn và mạng lưới kỹ thuật nhờ hiệu suất của nó trong các bài kiểm tra chỉnh sửa hình ảnh bằng trí tuệ nhân tạo. Điều tưởng chừng như bí ẩn giờ đây đã có tác giả: đằng sau đó là Google và công cụ xử lý hình ảnh mới của họ được tích hợp vào Gemini.

Công ty xác nhận rằng Nano Banana là tên gọi khác của Gemini 2.5 Flash Image , một hệ thống có khả năng tạo và chỉnh sửa ảnh bằng ngôn ngữ tự nhiên, duy trì phong cách, nhân vật và đối tượng với sự nhất quán mà trước đây các mô hình này khó có thể làm được.

Nano Banana là gì và ai là người đứng sau công ty này?

Trong những lần xuất hiện đầu tiên, mô hình này được giới thiệu trên bảng xếp hạng LM Arena với biệt danh "Nano Banana", gây ra nhiều đồn đoán và trò đùa về "chuối" cho đến khi Google chính thức giới thiệu nó như một phần của Gemini. Ý tưởng cơ bản rất rõ ràng: hợp nhất việc tạo và chỉnh sửa hình ảnh thành một quy trình làm việc đơn giản, dễ trò chuyện và nhanh chóng.

Google nhấn mạnh rằng phương pháp của họ dựa trên kiến ​​thức về thế giới và các mô hình AI tiên tiến của Gemini , giúp hiểu ngữ cảnh của các chỉ dẫn và áp dụng các thay đổi chính xác hơn so với các công cụ tạo hình ảnh thuần túy.

Chỉnh sửa hình ảnh AI trong Gemini

Chỉnh sửa đàm thoại: từ nhắc nhở đến tinh chỉnh

Mô hình hoạt động với các lệnh bằng ngôn ngữ tự nhiên và cho phép bạn tương tác với hình ảnh: bạn có thể yêu cầu "làm cho bầu trời ấn tượng hơn", "xóa biển báo đó" hoặc "đổi màu xe thành màu đỏ" và tinh chỉnh kết quả qua các vòng lặp liên tiếp mà không cần bắt đầu lại từ đầu.

Tính năng tương tác đa lượt này giúp giảm thiểu sự khó khăn thường gặp ở các công cụ truyền thống. Theo Google, người dùng có thể chọn các khu vực cụ thể để điều chỉnh màu sắc, ánh sáng hoặc kết cấu, loại bỏ các yếu tố không mong muốn, thay thế hình nền và thêm các đối tượng tích hợp liền mạch trong khi vẫn giữ nguyên bóng và phối cảnh.

  Cách sử dụng Pollo AI để tạo hình ảnh và giải pháp thay thế tốt nhất

Ngoài các thao tác chỉnh sửa cơ bản, nền tảng này còn hiểu các hướng dẫn như "đặt cùng một nhân vật vào một cảnh khác" hoặc "hiển thị sản phẩm từ nhiều góc độ khác nhau", giúp bảo toàn chủ thể và diện mạo của nó một cách nhất quán giữa các lần chỉnh sửa.

Tính nhất quán, chất lượng và tốc độ

Một trong những tiến bộ nổi bật là sự cải thiện về tính nhất quán hình ảnh giữa các phiên bản liên tiếp: các đặc điểm khuôn mặt, bàn tay, thú cưng và đồ vật vẫn ổn định với ít biến dạng hơn, điều mà trước đây từng là vấn đề đối với các mô hình tạo sinh.

Chủ nghĩa hiện thực ảnh được tăng cường với ánh sáng và kết cấu tự nhiên hơn, và Google tuyên bố hiệu năng cực nhanh giúp tăng tốc chu kỳ sáng tạo cho các tác vụ như tạo ra các biến thể sản phẩm hoặc các cảnh theo chủ đề.

Trong các thử nghiệm cộng đồng, hệ thống đã leo lên thứ hạng cao trong LM Arena về chỉnh sửa ảnh, tự khẳng định vị thế của mình trong số các công cụ có trải nghiệm người dùng tốt nhất theo đánh giá của người dùng.

Các công cụ chính và trường hợp sử dụng

Gemini 2.5 Flash Image bao gồm các tính năng được thiết kế cho cả người dùng thông thường và các nhóm sáng tạo. Một số tính năng nổi bật nhất cho phép bạn ghép các hình ảnh từ nhiều nguồn khác nhau và đặt chúng vào một bố cục mạch lạc.

  • Chỉnh sửa theo ngữ cảnh: điều chỉnh màu sắc, độ phơi sáng, kết cấu hoặc kiểu dáng mà không làm mất đi các yếu tố chính của bản gốc.
  • Tháo và thay thế: xóa đối tượng, thay đổi nền hoặc thêm các thành phần có tích hợp ánh sáng và bóng tối.
  • Thành phần và hỗn hợp: kết hợp hai bức ảnh thành một cảnh và chuyển các mẫu hoặc phong cách từ hình ảnh này sang hình ảnh khác.
  • Phiên bản nhiều ca: thay đổi chuỗi (sơn tường, thêm đồ nội thất, sửa đổi tủ quần áo) mà không cần khởi động lại quy trình.

Trong lĩnh vực tiếp thị, trang trí, thời trang hoặc nội dung truyền thông xã hội, công cụ này được sử dụng để nhanh chóng tạo ra các biến thể, duy trì tính nhất quán của nguồn lực thương hiệu và thử nghiệm các ý tưởng hình ảnh mà không cần sử dụng phần mềm truyền thống.

Giới hạn bảo mật và sử dụng

Để giảm thiểu lạm dụng, Google áp dụng các bộ lọc chặn nội dung bạo lực hoặc khiêu dâm và hạn chế chỉnh sửa hình ảnh người thật hoặc nhân vật công chúng. Mục tiêu là giảm nguy cơ thông tin sai lệch và deepfake.

  Gemini God Mode: Tính năng tiên tiến nhất của Google đã có mặt

Tất cả hình ảnh được tạo ra hoặc chỉnh sửa đều tích hợp SynthID , một dấu bản quyền kỹ thuật số không thể nhận biết được nằm trong chính tệp tin, giúp xác minh nguồn gốc của nó. Ngoài ra, công ty cũng đề cập đến các tín hiệu và biện pháp kiểm soát chủ động khác để tăng cường khả năng truy xuất nguồn gốc.

Chính sách sử dụng nghiêm cấm việc tạo ra nội dung riêng tư mà không có sự đồng ý và các loại nội dung nhạy cảm khác, nhấn mạnh sự tập trung vào trí tuệ nhân tạo có trách nhiệm trong các dịch vụ của Gemini.

Cách sử dụng Nano Banana trong ứng dụng Gemini

Cách sử dụng rất đơn giản: không cần cài đặt thêm bất cứ thứ gì hoặc chọn một kiểu máy cụ thể. Chỉ cần mở Gemini, tải ảnh lên và mô tả các thay đổi . Nếu bạn muốn giữ lại mọi thứ ngoại trừ một điều chỉnh, bạn có thể bắt đầu bằng "Trong ảnh gốc,..." để làm rõ rằng phần còn lại cần được giữ nguyên.

Một số ví dụ hữu ích: "chuyển sang đen trắng", "xóa cột góc", "thêm một con chó trên ghế dài", hoặc "đổi màu váy thành màu xanh lá cây". Hệ thống cố gắng duy trì các đặc điểm và tỷ lệ của đối tượng trong khi áp dụng thay đổi.

Bạn cũng có thể tải lên hai ảnh và yêu cầu nội dung của ảnh này xuất hiện trong ảnh kia, hoặc yêu cầu chuyển kiểu họa tiết (ví dụ: cánh bướm) lên quần áo hoặc vật thể trong ảnh thứ hai.

Khả năng tiếp cận và khả năng truy cập cho các nhà phát triển

Chức năng này có sẵn trong ứng dụng Gemini dành cho người dùng phổ thông. Đối với các tích hợp chuyên nghiệp, chức năng này có thể được truy cập thông qua API của Gemini, Google AI Studio và Vertex AI, mở ra cánh cửa cho các quy trình làm việc trong doanh nghiệp và các ứng dụng của bên thứ ba.

Việc sử dụng trong ứng dụng là miễn phí với những giới hạn hợp lý. Đối với các nhà phát triển, Google cung cấp mô hình định giá trả theo mức sử dụng ; mức giá 30 đô la cho mỗi triệu token được đề cập trong API như một tham khảo, với ước tính sơ bộ cho thấy mỗi hình ảnh có giá vài xu, tùy thuộc vào trường hợp sử dụng.

  Cách gỡ bỏ các tính năng AI trong Windows 11

Bối cảnh cạnh tranh

Động thái này nhắm thẳng vào các đối thủ như Midjourney và DALL·E (OpenAI). Chiến lược của Google tập trung vào chỉnh sửa hội thoại và kết quả nhất quán, được hỗ trợ bởi khả năng hiểu ngữ cảnh của Gemini.

Với việc tích hợp tên gọi Nano Banana vào hệ sinh thái của mình, công ty đang cố gắng thu hẹp khoảng cách trong một lĩnh vực mà tốc độ, chất lượng và khả năng kiểm soát là rất quan trọng đối với người dùng cuối.

Câu hỏi thường gặp

Nano Banana có phải là ứng dụng độc lập không?

Không. Đó là một mô hình nằm trong Gemini , vì vậy nó được sử dụng từ giao diện của chính ứng dụng đó.

Người dùng cuối có phải trả chi phí không?

Ứng dụng Gemini cung cấp dịch vụ miễn phí với giới hạn sử dụng. Việc tích hợp API sẽ phát sinh phí.

Tôi có phải chọn mô hình theo cách thủ công không?

Không. Việc lựa chọn diễn ra tự động khi bạn thực hiện các chức năng tạo hoặc chỉnh sửa ảnh trong Gemini.

Với trọng tâm là chỉnh sửa hội thoại, tính nhất quán chủ thể giữa các bức ảnh và các biện pháp bảo mật tích hợp, Nano Banana (Gemini 2.5 Flash Image) đang dần trở thành một lựa chọn vững chắc để tạo và chỉnh sửa hình ảnh trong cuộc sống hàng ngày cũng như trong các dự án chuyên nghiệp, dù là từ ứng dụng Gemini hay thông qua API của nó.

studio trong mơ
Bài viết liên quan:
DreamStudio: Nó là gì và cách tạo hình ảnh bằng trí tuệ nhân tạo