Đặc điểm của cung Song Tử 3: mọi thứ đều thay đổi và tại sao chúng lại quan trọng

Cập nhật lần cuối: 23 de noviembre de 2025
  • Gemini 3 ra mắt giao diện tạo sinh và cải thiện khả năng suy luận ở cấp độ chuyên gia.
  • Nâng cao tính đa phương thức với 1 triệu mã thông báo và cải thiện kết quả hình ảnh và video.
  • Các tác nhân có khả năng hơn: Chống trọng lực, tích hợp không gian làm việc và sử dụng công cụ.
  • Triển khai rộng rãi và tăng cường bảo mật, với quyền truy cập vào ứng dụng, Tìm kiếm, AI Studio và Vertex AI.

Tính năng của Gemini 3

Thế hệ trí tuệ nhân tạo mới của Google ra đời với một tham vọng rõ ràng: chuyển từ giao tiếp sang thực thi. Với Gemini 3, công ty đã có một bước tiến vượt bậc về khả năng suy luận, đa phương thức và khả năng hoạt động như một tác nhân , đồng thời giới thiệu một cách tương tác khác: giao diện do chính mô hình tạo ra ngay lập tức để giúp bạn đạt được mục tiêu mà không lãng phí thời gian vào các bước trung gian.

Tất cả những điều này đi kèm với việc thiết kế lại ứng dụng, cải tiến Google Search, Workspace và các công cụ dành cho nhà phát triển , cùng với sự tập trung mạnh mẽ vào bảo mật. Có những thay đổi đáng chú ý đối với mọi người, nhưng nhiều cải tiến quan trọng nhất sẽ được thấy ở các ứng dụng nâng cao: lập trình, phân tích dữ liệu, làm việc với video và hình ảnh, và tự động hóa với các tác nhân lập kế hoạch và hành động dưới sự giám sát của con người.

Gemini 3 là gì và tại sao nó lại đánh dấu bước ngoặt?

Trên thực tế, điều này dẫn đến những phản hồi trực tiếp và hữu ích hơn, giảm thiểu "lời khen ngợi" thường thấy ở một số chatbot, và khả năng hiểu ngữ cảnh tốt hơn , ngay cả khi làm việc với các đầu vào dài hoặc không đồng nhất (văn bản, hình ảnh, video, âm thanh và mã).

Ngoài ra, Google đã triển khai Gemini 3 trên nhiều nền tảng khác nhau ngay từ ngày đầu tiên: ứng dụng Gemini, Chế độ AI của công cụ tìm kiếm, AI Studio, Vertex AI, giao diện dòng lệnh (CLI) của mô hình và một nền tảng tác nhân mới có tên Google Antigravity , được thiết kế để lập kế hoạch và thực hiện các tác vụ phần mềm phức tạp với quyền truy cập vào trình chỉnh sửa, thiết bị đầu cuối và trình duyệt.

Để nhấn mạnh quy mô của sự kiện ra mắt, công ty nhắc lại tác động tích lũy của kỷ nguyên Gemini: trải nghiệm View được hỗ trợ bởi AI tiếp cận hàng tỷ người mỗi tháng, ứng dụng vượt qua hàng trăm triệu người dùng, hầu hết khách hàng của Google Cloud đã sử dụng các khả năng AI và hàng triệu nhà phát triển đã xây dựng các giải pháp với các mô hình tạo sinh của nó.

Tin tức Song Tử 3

Giao diện sáng tạo và trải nghiệm người dùng mới

Gemini 3 ra mắt với giao diện ứng dụng gọn gàng, hiện đại hơn, giúp bạn dễ dàng bắt đầu cuộc trò chuyện và tìm thấy những gì mình đã tạo trong thư mục "Đồ của tôi" . Việc thiết kế lại không chỉ đơn thuần là thay đổi về mặt hình thức: bước tiến lớn nằm ở giao diện tạo sinh , một loại phản hồi trong đó mô hình xác định định dạng tối ưu và tạo ra hình ảnh động thay vì một khối văn bản đơn thuần.

Trong số những thử nghiệm đầu tiên có “thiết kế trực quan” ( giao diện kiểu tạp chí với ảnh và các mô-đun tương tác) và “giao diện động”, được thiết kế để khám phá và cá nhân hóa kết quả. Nếu bạn yêu cầu nó “lập kế hoạch chuyến đi 3 ngày đến Rome vào mùa hè”, bạn sẽ nhận được một lịch trình trực quan có thể điều hướng với các câu hỏi tiếp theo và các yếu tố tương tác.

Ý tưởng này liên quan đến cái gọi là lập trình cảm xúc : bạn mô tả mục tiêu bằng ngôn ngữ tự nhiên, và hệ thống sẽ tạo ra giao diện hoặc mã cần thiết để đạt được mục tiêu đó. Vì vậy, nếu một sơ đồ, hình ảnh động hoặc ứng dụng nhỏ tương tác tốt hơn một đoạn văn, Gemini 3 sẽ tạo ra nó trong quá trình sử dụng, mà không buộc bạn phải chuyển đổi công cụ.

Trải nghiệm mua sắm cũng được nâng lên một tầm cao mới: danh sách sản phẩm, bảng so sánh và giá cả được tích hợp trực tiếp từ Google Shopping Graph (với hàng chục tỷ kết quả tìm kiếm) để xây dựng các hướng dẫn tương tác mà không cần rời khỏi quy trình, theo phong cách của một trang đề xuất chuyên biệt, nhưng được tạo ra tức thời bởi mô hình.

  Cách kiếm tiền trên YouTube mà không cần trở thành người có tầm ảnh hưởng

Một cải tiến thiết thực khác là, trong công cụ tìm kiếm, một nhóm người dùng giới hạn có thể chọn biến thể Gemini 3 Pro thiên về lý luận để nhận được các bản tóm tắt toàn diện và có căn cứ hơn, chứ không chỉ là phản hồi tổng hợp của chế độ hiện tại.

Giao diện tạo Gemini 3

Chế độ suy luận nâng cao và tư duy sâu

Google nhấn mạnh sự cải thiện đáng kể trong các bài kiểm tra độ khó cao: hãng cho rằng máy có khả năng suy luận ở cấp độ tiến sĩ , với kết quả cạnh tranh cao trong các bài kiểm tra như Humanity's Last Exam và GPQA Diamond. Về mặt số liệu, Gemini 3 Pro đạt điểm số như 37,5% trong HLE (không sử dụng công cụ) và 91,9% trong GPQA Diamond, đồng thời thiết lập hiệu năng hàng đầu trong toán học với 23,4% trong MathArena Apex.

Chế độ Tư duy Sâu ( Deep Think) của Gemini 3 đưa mọi thứ tiến thêm một bước nữa đối với những thách thức đặc biệt phức tạp và mới lạ. Trong các bài đánh giá nội bộ, nó vượt trội hơn phiên bản Pro trên nhiều phương diện: đạt 41,0% trong bài kiểm tra Humanity's Last Exam (không sử dụng công cụ), 93,8% trong GPQA Diamond và 45,1% trong ARC-AGI khi cho phép thực thi mã – sự kết hợp giữa suy luận biểu tượng, sử dụng công cụ và lập trình được thiết kế cho các vấn đề khó khăn.

Trong các lĩnh vực tác nhân, mô hình thể hiện hiệu suất tốt trong Terminal-Bench 2.0 (54,2%), đo lường khả năng điều khiển máy tính thông qua thiết bị đầu cuối, và duy trì khả năng ra quyết định ổn định trong môi trường kéo dài như Vending-Bench 2 , nơi nó đạt được lợi nhuận ròng hơn năm nghìn đô la trong một mô phỏng kinh doanh trong suốt một năm ảo.

Ngoài các chỉ số đo lường, điều quan trọng là sự thay đổi vai trò: từ một trợ lý phản hồi thụ động thành một tác nhân chủ động . Gemini 3 lập kế hoạch, chia nhỏ nhiệm vụ thành các bước, yêu cầu phê duyệt khi cần thiết và thực hiện với sự giám sát của con người. Nó có thể sắp xếp hộp thư đến Gmail, tổ chức lịch trình bằng cách đối chiếu thời gian rảnh rỗi hoặc chuẩn bị một quy trình làm việc phức tạp bằng cách kết hợp suy luận, gọi công cụ và điều hướng.

Cộng đồng nhà phát triển và doanh nghiệp đã và đang chứng kiến ​​những cải tiến rõ rệt: khả năng hiểu trực quan tốt hơn, tạo mã đáng tin cậy hơn và hiệu suất được nâng cao đối với các tác vụ kéo dài. Tất cả những điều này dẫn đến các tác nhân hữu ích hơn, có khả năng duy trì các dự án một cách nhất quán và bám sát tiến độ theo thời gian.

Lý luận và suy nghĩ sâu sắc ở cung Song Tử 3

Đa phương thức và bối cảnh quy mô lớn

Gemini 3 Pro tăng cường khả năng hiểu đa phương thức và nâng cao tiêu chuẩn về hình ảnh và video: nó vượt trội trong MMMU-Pro (81%) và Video-MMMU (87,2%), đồng thời cho thấy sự tiến bộ về độ chính xác thực tế với SimpleQA Verified (72,1%). Chìa khóa nằm ở khả năng kết hợp văn bản, mã, ảnh, âm thanh và video clip trong cùng một ngữ cảnh, diễn giải các mối quan hệ và sắc thái.

Mô hình này xử lý lượng dữ liệu lớn nhờ cửa sổ ngữ cảnh có 1 triệu token , đủ cho các bài viết dài, toàn bộ các lớp học, kho mã nguồn hoặc nhiều tài liệu chạy song song. Điều này cho phép các ứng dụng rất thiết thực: từ việc thống nhất các công thức nấu ăn gia đình viết tay (thậm chí bằng nhiều ngôn ngữ) và biến chúng thành một cuốn sách dạy nấu ăn, đến việc chuyển đổi các bài báo khoa học và video dài thành các thẻ tương tác và hình ảnh trực quan.

Đối với lập trình viên, Google nói về một bước tiến vượt bậc trong phân tích mã, suy luận trừu tượng và thực thi có kiểm soát. Trong các kịch bản hỗ trợ phát triển như Code Assist 3.0 , nó mô tả sự hiểu biết về toàn bộ kiến ​​trúc kho lưu trữ và cửa sổ ngữ cảnh mở rộng lên đến 10 triệu mã thông báo, hữu ích cho việc phát hiện các phụ thuộc có thể bị phá vỡ bởi một thay đổi cục bộ.

  Hướng dẫn đầy đủ về cách chuẩn bị dữ liệu cho Trí tuệ nhân tạo tác nhân

Mô hình này cũng cải thiện khả năng suy luận song song với dữ liệu hình ảnh và văn bản, giúp tinh chỉnh việc diễn giải các bảng, sơ đồ và giao diện. Sự tiến bộ này rất quan trọng khi điều quan trọng không chỉ là "nhìn thấy" hình ảnh, mà còn là đối chiếu nó với văn bản và số liệu để đưa ra kết luận và hành động.

Do đó, câu trả lời không phải lúc nào cũng chỉ dựa trên văn bản: đôi khi câu trả lời lý tưởng là một ứng dụng web tương tác (máy tính, trình mô phỏng hoặc tiện ích thời gian thực) cho phép bạn khám phá giải pháp một cách trực quan hơn ngay trong quy trình Gemini.

Đa phương thức và bối cảnh trong Gemini 3

Các tác nhân, sự phát triển và nền tảng Google Antigravity

Gemini 3 hiện đã có sẵn cho các nhà phát triển trong Google AI Studio , Vertex AI và CLI, đồng thời giới thiệu Google Antigravity , một nền tảng phát triển dựa trên tác nhân với quyền truy cập trực tiếp vào trình chỉnh sửa, thiết bị đầu cuối và trình duyệt. Hệ thống có thể lập kế hoạch và thực hiện các tác vụ phần mềm từ đầu đến cuối , xác thực mã của chính nó và phối hợp với các bề mặt khác trong họ Gemini (chẳng hạn như điều khiển máy tính và chỉnh sửa hình ảnh).

Mô hình này dẫn đầu trong các bài kiểm tra hiệu năng như WebDev Arena (1.487 ELO), đạt 54,2% trong Terminal-Bench 2.0 và 76,2% trong SWE-bench Verified, vượt trội trong việc tạo mã không cần ví dụ và tạo giao diện web phong phú từ các hướng dẫn phức tạp. Đối với doanh nghiệp, điều này giúp tăng tốc quá trình phát triển các giải pháp tùy chỉnh, dựa trên tác nhân.

Các ví dụ thực tế đã tận dụng điều này: các công ty tạo ra các bài thuyết trình tự động đang cung cấp cho mô hình các tài liệu kỹ thuật để tạo ra những sản phẩm mà trước đây một nhà phân tích phải mất hàng giờ để hoàn thành. Với Gemini 3, công việc đó được rút ngắn chỉ còn vài phút , nhờ vào khả năng suy luận đa phương thức và ngữ cảnh mở rộng.

Tích hợp với Google Workspace và công cụ tìm kiếm

Tác động rõ rệt nhất đối với các nhóm sẽ đến từ Google Workspace . Gemini không còn chỉ là một thanh bên nữa; giờ đây nó được tích hợp như một công cụ bên trong Gmail, Docs, Sheets, Calendar, YouTube và Maps. Ví dụ, trong Gmail, nó không chỉ tóm tắt mà còn soạn thảo, ưu tiên, trả lời và lên lịch các cuộc họp dựa trên thời gian rảnh thực tế của bạn. Trong Sheets, nó hoạt động như một nhà phân tích dữ liệu, tạo biểu đồ và bảng tổng hợp dựa trên các câu hỏi của bạn.

Gemini Vids cũng được hợp nhất , có khả năng tạo ra các bài thuyết trình video hoàn chỉnh từ tài liệu Drive, và khả năng cộng tác với nội dung đa phương thức được tăng cường: mô hình hiểu và kết hợp văn bản, hình ảnh và video clip để tạo ra các tài sản hữu ích trong thời gian ngắn hơn.

Trong Tìm kiếm , ngoài các bản tóm tắt được hỗ trợ bởi AI, một số người dùng có thể nâng cấp lên Gemini 3 Pro để nhận được câu trả lời chi tiết hơn dựa trên khả năng phân tích của nó. Và trong Mua sắm, Gemini sử dụng Google Shopping Graph để tạo ra các hướng dẫn đề xuất với giá cả và chi tiết cập nhật mà không làm gián đoạn trải nghiệm của bạn.

Một cải tiến đáng chú ý khác là công cụ tìm kiếm có thể phân tích câu hỏi của bạn thành các truy vấn con tốt hơn, tự động điều tra thay bạn, giúp hiểu rõ hơn ý định và tránh bỏ sót những thông tin trước đây.

Nhìn chung, sự tích hợp này hứa hẹn giảm thiểu sự bất tiện : bạn yêu cầu những gì mình cần và, nếu phù hợp, mô hình sẽ tạo ra giao diện, bảng, lịch hoặc ứng dụng thu nhỏ trong cùng một quy trình, mà không buộc bạn phải chuyển đổi giữa các tab.

Tính khả dụng, triển khai và bảo mật

Google khẳng định Gemini 3 là mô hình bảo mật nhất của họ cho đến nay , nhờ vào bộ đánh giá toàn diện nhất mà họ từng thực hiện. Những cải tiến bao gồm giảm thiểu các lỗ hổng, tăng cường khả năng chống lại các cuộc tấn công chèn mã độc tức thời và tăng cường khả năng phòng thủ chống lại việc lạm dụng liên quan đến các cuộc tấn công mạng, được xác nhận bởi các chuyên gia độc lập và các tổ chức bên ngoài (như AISI của Anh ) và các công ty chuyên ngành.

  NVIDIA DLSS 5 là gì và cách sử dụng nó trong các trò chơi PC của bạn?

Việc triển khai rất quy mô: người dùng cuối có thể tìm thấy nó trong ứng dụng Gemini và Chế độ AI của công cụ tìm kiếm, các nhà phát triển có thể tìm thấy trong Gemini API, AI Studio, Antigravity và CLI , còn các tổ chức thì có thể tìm thấy thông qua Vertex AI và Gemini Enterprise. Một số tính năng nâng cao, chẳng hạn như Deep Think và một số khả năng của tác nhân, ban đầu được cung cấp cho người đăng ký Google AI Ultra và sẽ được mở rộng theo thời gian.

Một lưu ý thực tế: Gemini 3 Pro được cung cấp miễn phí ngay từ ngày đầu tiên trên ứng dụng và web, điều chưa từng có trước đây, mặc dù việc nâng cấp lên phiên bản Pro trong Tìm kiếm hiện chỉ dành cho các gói trả phí. Hơn nữa, bạn đã có thể thử nghiệm tính năng này từ Google AI Studio, và việc triển khai rộng rãi sẽ được kích hoạt trong những ngày tới tùy thuộc vào khu vực và sản phẩm.

Google củng cố quyết định triển khai bằng dữ liệu về mức độ sử dụng: trải nghiệm AI trong công cụ tìm kiếm đạt hàng tỷ người dùng hàng tháng, ứng dụng này có hơn nửa tỷ người dùng, hơn 70% khách hàng của Google Cloud sử dụng các khả năng AI và 13 triệu nhà phát triển đã tạo ra các giải pháp bằng mô hình của nó.

Ứng dụng trong công ty và trường hợp sử dụng

Trong môi trường doanh nghiệp, Gemini 3 cho phép thiết kế các giải pháp tùy chỉnh tích hợp các tác nhân, tự động hóa và trí tuệ nhân tạo đa phương thức vào các quy trình quan trọng. Điều này bao gồm từ việc hỗ trợ phát triển và cải thiện các đường dẫn dữ liệu đến việc tạo ra các trải nghiệm hội thoại xử lý tài liệu, hình ảnh và video với một phương pháp thống nhất.

Nhiều công ty kết hợp các khả năng này với các biện pháp an ninh mạng và kiểm thử xâm nhập để bảo vệ mô hình và dữ liệu, đồng thời triển khai cơ sở hạ tầng đám mây (AWS và Azure) đảm bảo khả năng mở rộng, tính sẵn sàng và tuân thủ. Trong phân tích dữ liệu, bảng điều khiển và dịch vụ kinh doanh thông minh (ví dụ: với Power BI) được tích hợp để chuyển đổi dữ liệu thành các quyết định có thể hành động, dựa trên khả năng suy luận của mô hình và việc tạo ra các hình ảnh trực quan .

Bộ công cụ này cũng được hưởng lợi từ việc tích hợp với Google Search , giúp dẫn dắt các câu trả lời đến thông tin đáng tin cậy về các chủ đề hiện tại, giảm thiểu thông tin sai lệch. Về mặt lập trình, Gemini 3 hiểu kiến ​​trúc kho lưu trữ, đề xuất các thay đổi và cảnh báo về các phụ thuộc có khả năng bị lỗi, giúp tiết kiệm thời gian cho các nhóm kỹ thuật.

Nhìn về phía trước, Google dự đoán khả năng tùy chỉnh triệt để : các mô hình tự động điều chỉnh một cách riêng tư và an toàn theo phong cách, giọng điệu và chuyên môn của tổ chức bạn mà không cần đến các quy trình tinh chỉnh phức tạp . Và lưu ý: trong khi người dùng thông thường có thể không nhận thấy tất cả các thay đổi, các nhóm kỹ thuật và dữ liệu sẽ thấy những cải tiến rõ rệt về độ chính xác, tốc độ và khả năng xử lý.

Gemini 3 định nghĩa lại cách chúng ta làm việc với AI bằng cách kết hợp khả năng suy luận tiên tiến, các tác nhân thực tiễn và giao diện tạo sinh: ít trở ngại hơn, nhiều ngữ cảnh hơn và khả năng tạo ra trải nghiệm tương tác giúp bạn từ mục tiêu đến thực thi chỉ với một vài gợi ý được cung cấp đầy đủ.

robot song tử-0
Bài viết liên quan:
Google cách mạng hóa ngành robot với AI Gemini Robotics