Claude Sonnet 4.5: Các tác nhân lập trình, sử dụng máy tính và theo dõi tiến độ

Cập nhật lần cuối: 6 Tháng Mười 2025
  • Sonnet 4.5 cung cấp các tác nhân bền bỉ, mã tốt hơn và khả năng tính toán đáng tin cậy, với 64K mã thông báo đầu ra và thời gian tập trung hơn 30 giờ.
  • Claude Code cập nhật (điểm kiểm tra, thiết bị đầu cuối, VS Code), thêm chức năng chỉnh sửa bộ nhớ và ngữ cảnh vào API và khởi chạy Agent SDK.
  • Công nghệ này có nhiều cải tiến về bảo mật (ASL-3, ít báo động giả, khả năng phòng thủ trước mã độc tiêm ngay) và hoạt động tốt trên SWE-bench và OSWorld.
  • Có sẵn trên Claude.ai, API, Bedrock và Vertex AI, với mức giá từ 3 đến 15 đô la, có tiết kiệm cho việc lưu trữ đệm và xử lý theo lô.

Mô hình AI cho lập trình và tác nhân

Sự ra mắt của Claude Sonnet 4.5 đã thổi bùng lĩnh vực trí tuệ nhân tạo ứng dụng vào các tác nhân và phát triển phần mềm, với những hứa hẹn từ lập trình tự động và xử lý máy tính đến những tiến bộ hữu hình trong suy luận và toán học. Anthropic giới thiệu đây là mô hình có khả năng nhất của họ cho đến nay, với trọng tâm rất rõ ràng: biến Claude thành nhiều hơn chỉ là một trợ lý đàm thoại, đưa nó vào lĩnh vực "tác nhân biết hành động".

Song song đó, công ty đang củng cố hệ sinh thái của mình bằng những cải tiến cho Claude Code, các công cụ dành cho nhà phát triển mới và một lớp bảo mật và đồng bộ hóa nghiêm ngặt hơn. Thông điệp rất tham vọng: mô hình tốt nhất cho các tác nhân, mã nguồn và việc sử dụng điện toán , được hỗ trợ bởi các chỉ số như SWE-bench Verified và OSWorld, cùng với một loạt các tính năng được thiết kế để hỗ trợ các nhiệm vụ phức tạp và lâu dài hơn.

Claude Sonnet 4.5 là gì và nó hứa hẹn điều gì?

Anthropic mô tả Sonnet 4.5 là mô hình mạnh mẽ nhất của họ trong các lĩnh vực quan trọng: xây dựng các tác nhân phức tạp, tạo và bảo trì mã, và điều khiển bằng máy tính . Nó không chỉ đơn thuần là việc đặt tên; công ty khẳng định những cải tiến rõ rệt trong khả năng suy luận và toán học, hai trụ cột tạo nên sự khác biệt khi các dự án bao gồm nhiều bước và sự phụ thuộc lẫn nhau.

Một trong những tính năng nổi bật nhất của nó là khả năng duy trì các tác vụ phức tạp trong hơn 30 giờ liên tục, giữ vững sự tập trung mà không cần can thiệp trực tiếp. Trên thực tế, điều này có nghĩa là một tác nhân có thể kiên trì thực hiện các công việc phối hợp dài hạn mà không bị mất phương hướng. Hơn nữa, mô hình hỗ trợ đầu ra lên đến 64.000 token, rất hữu ích cho việc lập kế hoạch chi tiết và tạo ra các khối mã lớn.

Trong các bài kiểm tra hiệu năng công khai, Anthropic khẳng định Sonnet 4.5 là phần mềm tiên tiến nhất theo đánh giá của SWE-bench Verified, một công cụ đo lường khả năng giải quyết các vấn đề thực tế của phần mềm. Nó cũng đạt điểm số cao trong OSWorld với 61,4%, cho thấy những cải tiến đáng kể trong môi trường máy tính để bàn thực tế . Chính công ty này cũng so sánh con số 61,4% này với 42,2% mà Sonnet 4 đạt được vài tháng trước, một sự gia tăng đáng kể.

Ngoài hiệu năng vượt trội, công ty nhấn mạnh rằng đây là mô hình "tiên phong" phù hợp nhất của họ: các hành vi đáng lo ngại như nịnh hót quá mức, tìm kiếm quyền lực hoặc xu hướng ủng hộ lý luận ảo tưởng đã được giảm thiểu , và khả năng phòng vệ chống lại các cuộc tấn công chèn mã độc nhanh chóng trong các kịch bản sử dụng máy tính và năng lực của tác nhân đã được tăng cường.

Các tính năng và trường hợp sử dụng của Claude Sonnet

Cập nhật hệ sinh thái: Mã Claude, Ứng dụng và Nền tảng

Sonnet 4.5 ra mắt với bản cập nhật sản phẩm lớn. Claude Code giới thiệu tính năng điểm kiểm tra (checkpoints) , một trong những tính năng được yêu cầu nhiều nhất: chúng lưu lại tiến trình và cho phép người dùng ngay lập tức quay lại trạng thái trước đó. Đối với bất kỳ ai phát triển phần mềm với chu kỳ lặp dài, thay đổi này giúp giảm thiểu khó khăn và mang lại sự tự tin để khám phá các hướng đi khác nhau mà không sợ làm hỏng mọi thứ.

Điều này bổ sung cho giao diện terminal được thiết kế lại và việc ra mắt tiện ích mở rộng gốc cho Visual Studio Code , với mục đích tích hợp Claude trực tiếp vào môi trường phát triển tích hợp (IDE) nơi các lập trình viên làm việc hàng ngày. Đây là một bước tiến đáng kể nếu mục tiêu là để mô hình này đảm nhận vai trò vận hành nhiều hơn và ít mang tính ngoại vi hơn.

Về phía API, có hai thành phần chính: chỉnh sửa ngữ cảnh và một công cụ bộ nhớ mới để lưu trữ và truy xuất thông tin . Cả hai cùng nhau cho phép các tác nhân hoạt động lâu hơn, lọc bỏ ngữ cảnh lỗi thời và giữ cho những thông tin thực sự quan trọng luôn có thể truy cập được — điều cần thiết khi quy trình làm việc kéo dài hàng giờ và các yêu cầu thay đổi liên tục.

  Gemini Code Assist: Trợ lý AI dành cho lập trình viên hiện đã có sẵn miễn phí

Trong các ứng dụng của Claude, một cải tiến quan trọng khác là khả năng chạy mã và tạo tệp (tài liệu, bảng tính và bản trình bày) ngay trong cuộc trò chuyện. Điều này cho phép mô hình phân tích dữ liệu, tạo nội dung và xuất ra các định dạng văn phòng mà không cần rời khỏi cuộc trò chuyện, kết hợp lý thuyết và thực tiễn trong cùng một luồng hội thoại.

Cuối cùng, tiện ích mở rộng Chrome chính thức của Claude đã có sẵn cho người dùng Max đã tham gia danh sách chờ, mở ra cơ hội tự động hóa các tác vụ trình duyệt một cách dễ dàng và đáng tin cậy hơn.

Claude Agent SDK: Các khối xây dựng để xây dựng tác nhân của riêng bạn

Anthropic không chỉ giới thiệu những khả năng của sản phẩm chủ lực mà còn cung cấp các khối xây dựng để người khác có thể tùy chỉnh nó. Bộ SDK Claude Agent mới chia sẻ cơ sở hạ tầng hỗ trợ Claude Code và được thiết kế để giải quyết các vấn đề khó khăn: quản lý bộ nhớ cho các tác vụ chạy dài hạn, hệ thống phân quyền cân bằng giữa quyền tự chủ và quyền kiểm soát của người dùng, và sự phối hợp giữa các tác nhân con cùng hướng tới một mục tiêu chung.

Đề xuất này nhằm chuyển đổi SDK này thành một nền tảng có thể tái sử dụng, để bất kỳ nhóm nào cũng có thể xây dựng tác nhân riêng của họ bằng cách sử dụng các công cụ đã được kiểm chứng trong thực tế . Anthropic khẳng định rằng, mặc dù ban đầu được phát triển cho các ứng dụng dựa trên mã, nhưng nó chứng minh được lợi ích trên nhiều nhiệm vụ khác nhau.

Xem trước nghiên cứu: "Hãy tưởng tượng cùng Claude"

Cùng với Sonnet 4.5, Anthropic cung cấp một trải nghiệm tạm thời có tên gọi "Hãy tưởng tượng cùng Claude". Trong thử nghiệm này, mô hình tạo ra phần mềm ngay lập tức mà không cần các chức năng được xác định trước , phản hồi tương tác của người dùng trong thời gian thực. Về cơ bản, đây là một cái nhìn thoáng qua về những gì có thể đạt được khi một mô hình có khả năng được kết hợp với cơ sở hạ tầng phù hợp.

Phiên bản xem trước có sẵn trong năm ngày cho người dùng đăng ký Max và có thể được truy cập tại claude.ai/imagine. Công ty giới thiệu đây là một màn trình diễn thú vị nhưng cũng đầy tính khám phá về khả năng của Sonnet 4.5 về mặt tạo lập và thích ứng.

An toàn, căn chỉnh và cấp độ ASL-3

Việc triển khai Sonnet 4.5 được hỗ trợ bởi mức độ bảo mật ASL-3, một khuôn khổ điều chỉnh khả năng của mô hình với các biện pháp bảo vệ thích hợp . Các biện pháp này bao gồm các bộ phân loại được thiết kế để phát hiện các đầu vào và đầu ra có khả năng gây nguy hiểm, tập trung vào môi trường CBRN (hóa học, sinh học, phóng xạ và hạt nhân).

Anthropic thừa nhận rằng các bộ phân loại này đôi khi có thể gắn cờ nhầm nội dung hợp pháp, và để tránh làm gián đoạn người dùng, họ đề nghị tiếp tục cuộc trò chuyện với Sonnet 4, ứng dụng có rủi ro CBRN thấp hơn. Kể từ khi mô tả các bộ lọc này lần đầu tiên, họ đã giảm số lượng cảnh báo sai xuống mười lần, và kể từ khi ra mắt Claude Opus 4 vào tháng 5, con số này đã giảm xuống còn một nửa. Họ hứa rằng khả năng phân biệt của các bộ phân loại sẽ tiếp tục được cải thiện.

Sự điều chỉnh này không chỉ dừng lại ở các bộ lọc: việc đào tạo và đánh giá bảo mật giờ đây lần đầu tiên bao gồm các bài kiểm tra lấy cảm hứng từ khả năng giải thích cơ học , với mục tiêu hiểu rõ hơn và kiểm soát hành vi bên trong của mô hình. Hơn nữa, các biện pháp phòng vệ chống lại việc tiêm mã độc tức thời đã được tăng cường, điều này đặc biệt quan trọng khi hệ thống đang duyệt web, hoạt động trong môi trường máy tính ảo hoặc thực hiện các tác vụ.

Tính khả dụng, tích hợp và giá cả

Claude Sonnet 4.5 hiện đã có mặt ở khắp mọi nơi. Các nhà phát triển có thể sử dụng nó thông qua API của Claude bằng cách gọi mô hình "claude-sonnet-4-5" . Giá vẫn giữ nguyên như thế hệ trước: 3 đô la cho mỗi triệu token đầu vào và 15 đô la cho mỗi triệu token đầu ra.

Anthropic mang lại lợi thế về chi phí nhờ cơ sở hạ tầng của mình: tiết kiệm đến 90% với bộ nhớ đệm tức thời và thêm 50% với xử lý theo lô – những con số được thiết kế cho khối lượng công việc lớn. Đối với người dùng cuối, tính năng trò chuyện có sẵn với Sonnet 4.5 trong Claude.ai (web, iOS và Android), còn đối với doanh nghiệp, tính năng này có sẵn trên Nền tảng nhà phát triển Claude, cũng như Amazon Bedrock và Google Cloud Vertex AI.

Về phía doanh nghiệp, có gói miễn phí với giới hạn phiên sử dụng được thiết lập lại sau mỗi năm giờ và số lượng tin nhắn theo yêu cầu có thể thay đổi. Và đối với các tác vụ lập trình phức tạp, Claude Code là nhà cung cấp hàng đầu.

  NotebookLM: Tất cả về công cụ của Google giúp chuyển đổi việc học tập và nghiên cứu

Các trường hợp sử dụng nổi bật

Sonnet 4.5 được giới thiệu như một mô hình lý tưởng cho các tác nhân: nó có thể phản hồi gần như tức thì hoặc triển khai quá trình tư duy từng bước rõ ràng khi nhiệm vụ yêu cầu. Người dùng API kiểm soát chính xác thời gian "suy nghĩ" của mô hình, lựa chọn giữa tốc độ và độ sâu.

Trong phát triển phần mềm, nó bao trùm toàn bộ vòng đời: lập kế hoạch, tạo ra mã, bảo trì, sửa lỗi và tái cấu trúc quy mô lớn . Ngữ cảnh đầu ra lớn (lên đến 64 token) tạo điều kiện thuận lợi cho việc tạo ra các kế hoạch và mã nguồn nhất quán, toàn diện.

Về khả năng sử dụng trên trình duyệt và máy tính để bàn, nó dẫn đầu trong lĩnh vực này: nó hoàn thành các quy trình làm việc thực tế từ phân tích cạnh tranh và mua hàng đến việc tiếp nhận khách hàng trên web. Mục tiêu là độ chính xác và độ tin cậy sẽ tiếp tục được cải thiện theo thời gian.

Trong lĩnh vực an ninh mạng, các nhóm kết hợp Sonnet 4.5 với Claude Code có thể triển khai các tác nhân tự động vá các lỗ hổng trước khi chúng bị khai thác, chuyển trọng tâm từ phát hiện phản ứng sang phòng thủ chủ động.

Trong lĩnh vực tài chính, mô hình này giải quyết việc phân tích đầu vào và dự đoán phức tạp ; ví dụ, nó giám sát các thay đổi quy định toàn cầu và chủ động điều chỉnh các hệ thống tuân thủ, chuyển từ việc chuẩn bị kiểm toán thủ công sang quản lý rủi ro thông minh.

Trong năng suất kinh doanh, nó vượt trội trong việc tạo và chỉnh sửa các tệp văn phòng (tài liệu, bảng tính, bài thuyết trình) . Và trong nghiên cứu, nó có thể theo dõi các nguồn nội bộ và bên ngoài để tổng hợp kiến ​​thức trong bối cảnh thông tin phức tạp.

Về nội dung, anh ấy xuất sắc trong việc viết với sự am hiểu về sắc thái và giọng điệu, tạo ra những văn bản thuyết phục hơn và phân tích ở cấp độ ngữ nghĩa sâu sắc hơn , một điểm mạnh có giá trị đối với tiếp thị, tài liệu kỹ thuật hoặc truyền thông doanh nghiệp.

Hiệu suất và số liệu

Dữ liệu do Anthropic cung cấp cho thấy Sonnet 4.5 đạt 77,2% trong SWE-bench Verified , hiệu suất tốt nhất từ ​​trước đến nay trong lĩnh vực lập trình. Trong OSWorld, nó đạt 61,4%, củng cố vị trí là mô hình "sử dụng máy tính" tốt nhất. Các chỉ số này được hỗ trợ bởi bằng chứng hoạt động thực tế với các tác vụ kéo dài hơn 30 giờ và khả năng xử lý 64 token.

Công ty khẳng định rằng Sonnet 4.5 hỗ trợ các tác nhân trong các lĩnh vực đòi hỏi cao như phân tích tài chính, an ninh mạng và nghiên cứu , điều phối nhiều tác nhân và xử lý khối lượng lớn dữ liệu với độ tin cậy mà các lĩnh vực này yêu cầu.

Sự phát triển của họ Sonnet và vị trí của 4.5

Để hiểu được bước tiến này, chúng ta cần nhìn lại quá khứ. Sonnet 3.7 đã giới thiệu mô hình suy luận lai giúp cải thiện đáng kể khả năng lập trình, tạo nội dung và phân tích dữ liệu. Sau đó, Sonnet 4 đã củng cố phương pháp đó với hiệu năng gần như hoàn hảo, phù hợp cho trợ lý người dùng và các tác vụ khối lượng lớn.

Sonnet 4.5 tiếp tục phát triển dựa trên nền tảng đó và tiến thêm một bước nữa: tham vọng của nó là trở thành lựa chọn chính xác nhất cho các tác vụ dài, các tác nhân phức tạp và việc sử dụng máy tính , với kiến ​​thức chuyên sâu hơn về lập trình, tài chính và an ninh mạng.

Những trường hợp thực tế và cộng đồng nói gì

Anthropic thông báo rằng họ đã cho Sonnet 4.5 hoạt động liên tục trong 30 giờ để xây dựng một bản sao của Slack . Theo công ty, tác nhân này đã tự động tạo ra 11.000 dòng mã và dừng lại khi hoàn thành nhiệm vụ. Vào tháng 5, mô hình Opus 4 của họ đã hoạt động được khoảng bảy giờ, vì vậy kỷ lục mới này vượt xa con số đó.

Câu chuyện nghe có vẻ ấn tượng, nhưng những chi tiết nhỏ lại xuất hiện ngoài những tài liệu quảng cáo. Các nhà phát triển như @midudev kể lại cách mô hình này đã tái cấu trúc toàn bộ dự án chỉ bằng một lệnh duy nhất — áp dụng các mẫu như kiến ​​trúc sạch và tạo ra hàng trăm hoặc hàng nghìn dòng mã — nhưng kết quả lại không hoạt động khi biên dịch. Những người khác cũng báo cáo điều tương tự: mã có cấu trúc hoàn hảo và vẻ ngoài chuyên nghiệp, nhưng lại bị lỗi khi chạy.

Người ta cũng chỉ ra rằng Anthropic chưa từng chứng minh được ứng dụng Slack được cho là hoạt động hoàn chỉnh từ đầu đến cuối, mà chỉ tuyên bố rằng họ đã xây dựng nó – một khoảng cách đáng kể giữa việc chỉ nói suông và việc chứng minh bằng mã nguồn có thể kiểm chứng . Mô hình này không phải là hiếm: trong toàn ngành, các mô hình được cải thiện bằng cách tạo ra mã nguồn trông rất tốt, nhưng chúng vẫn thường thất bại trong việc tạo ra các giải pháp hoạt động hiệu quả mà không cần sự can thiệp đáng kể của con người.

  GPT-4b Micro: OpenAI và AI của nó đã cách mạng hóa tuổi thọ của con người

Ngay cả nội bộ công ty cũng ngạc nhiên trước những cải tiến này. Dianne Penn chỉ ra rằng mô hình này sử dụng máy tính thành thạo hơn gấp ba lần so với phiên bản tháng Mười và họ đã dành tháng trước để làm việc với phản hồi từ GitHub và Cursor . Canva, với tư cách là người thử nghiệm phiên bản beta, cho biết nó giúp ích cho "các nhiệm vụ phức tạp, có bối cảnh dài". Scott White so sánh nó với "trình độ của một chánh văn phòng": điều phối lịch trình, phân tích dữ liệu và viết báo cáo.

Thông điệp cốt lõi rất rõ ràng: ngay cả với một mô hình mạnh mẽ, vẫn cần đến máy ảo, quản lý bộ nhớ và ngữ cảnh, hỗ trợ đa tác nhân và hệ thống phân quyền để triển khai các tác nhân đáng tin cậy hơn trong môi trường sản xuất. Đây chính là khoảng trống mà Agent SDK và các tính năng mới của nền tảng hướng đến lấp đầy.

Cạnh tranh và định vị thị trường

Việc ra mắt Sonnet 4.5 được xem là một phần của cuộc cạnh tranh căng thẳng: OpenAI đang tiến lên phía trước với thế hệ tiếp theo của mình, trong khi Google vẫn kiên trì với Gemini , thực hiện các động thái buộc mọi người phải đẩy nhanh nỗ lực của họ. Trong bối cảnh này, các tác nhân dài hạn, sử dụng máy tính trực tiếp và lập trình tự động là những lĩnh vực then chốt, nơi phần lớn giá trị kinh doanh đang bị đe dọa.

Bất cứ ai thuyết phục được các công ty rằng họ có thể tự động hóa các quy trình làm việc thực tế với khả năng kiểm soát và độ tin cậy cao sẽ giành được giấy phép và các triển khai quy mô lớn . Anthropic tin rằng việc kết hợp một mô hình mạnh mẽ với cơ sở hạ tầng phù hợp—cơ sở hạ tầng của chính họ—sẽ thu hẹp khoảng cách giữa các bản demo và hoạt động bền vững.

Khuyến nghị áp dụng và thực hành tốt

Nếu bạn thực sự muốn thử Sonnet 4.5, hãy nhớ rằng tính tự chủ không phải là không có cái giá của nó. Các hành động mà mô hình có thể thực hiện—đọc và chỉnh sửa tệp, di chuyển dữ liệu, thực thi lệnh và điều hướng—yêu cầu các quy tắc rõ ràng và sự giám sát. Việc kích hoạt hệ thống phân quyền, nhật ký kiểm toán và thiết lập ngưỡng can thiệp của con người là rất quan trọng để giảm thiểu rủi ro.

Trong quy trình viết mã, các điểm kiểm tra và bộ nhớ API của Claude Code giúp lặp lại một cách an toàn. Tuy nhiên, vẫn nên tự động hóa các quy trình kiểm thử và xác thực , đồng thời giới thiệu mô hình theo từng giai đoạn có kiểm soát (từ các tác vụ ít ảnh hưởng đến các thành phần quan trọng) trước khi giao phó các trách nhiệm chính.

Nơi để đọc thêm và cách bắt đầu

Anthropic khuyến nghị nâng cấp lên Sonnet 4.5 cho tất cả các mục đích sử dụng: ứng dụng, API và Claude Code. Họ giới thiệu bản nâng cấp này như một sự thay thế trực tiếp với hiệu suất được cải thiện mà vẫn giữ nguyên mức giá . Các tính năng mới trong Claude Code có sẵn cho tất cả người dùng; các bản cập nhật cho nền tảng dành cho nhà phát triển—bao gồm cả Agent SDK—có sẵn cho toàn bộ cộng đồng nhà phát triển; và việc thực thi mã và tạo tệp trong ứng dụng được bao gồm trong tất cả các gói trả phí.

Để biết thêm chi tiết kỹ thuật và kết quả đánh giá, công ty tham khảo thẻ hệ thống, trang mô hình và tài liệu hướng dẫn , cũng như các ấn phẩm kỹ thuật và bài đăng nghiên cứu về an ninh mạng. Bất cứ ai muốn thử nghiệm việc tạo phần mềm thời gian thực có thể dùng thử "Imagine with Claude" trong vài ngày.

Những thông báo này cho thấy một mô hình nâng cao tiêu chuẩn về các tác nhân, mã nguồn và việc sử dụng máy tính, đồng thời tăng cường khả năng mở rộng, bảo mật và các công cụ dành cho nhà phát triển. Liệu thực tiễn có phù hợp với lý thuyết đến mức nào vẫn còn phải chờ xem, nhưng đã có những dấu hiệu cụ thể về sự trưởng thành và một kế hoạch nhất quán để thu hẹp khoảng cách giữa "nói hay" và "làm hay".

Claude 4-1
Bài viết liên quan:
Claude 4: Anthropic tái hiện trí tuệ nhân tạo với các mô hình tiên tiến để lập trình và các tác nhân tự động