- Sonnet 4.5 impulsa agents duradors, millor codi i ús fiable de lordinador, amb 64K tokens de sortida i focus de més de 30 hores.
- Actualitza Claude Code (checkpoints, terminal, VS Code), afegeix memòria i edició de context a API i estrena l'Agent SDK.
- Avança en seguretat (ASL-3, menys falsos positius, defensa davant de prompt injection) i rendeix alt a SWE-bench i OSWorld.
- Disponible a Claude.ai, API, Bedrock i Vertex AI, amb preus de 3$/15$ i estalvis per memòria cau i lots.

L'arribada de Claude Sonnet 4.5 ha encès el tauler de la IA aplicada a agents i desenvolupament de programari, amb promeses que van des de la programació autònoma i el maneig de l'ordinador fins a avenços palpables en raonament i matemàtiques. Anthropic el presenta com el seu model més capaç fins ara, amb un enfocament molt clar: convertir Claude en alguna cosa més que un assistent de conversa, empenyent-lo cap al terreny de l'«agent que actua».
En paral·lel, la companyia reforça el seu ecosistema amb millores a Claude Code, noves eines per a desenvolupadors i una capa de seguretat i alineament més estricta. El discurs és ambiciós: el millor model per a agents, codi i ús informàtic , sostingut per mètriques com SWE-bench Verified i OSWorld, a més d'una bateria de funcions que pretenen facilitar tasques de llarg recorregut i més complexitat.
Què és i què promet Claude Sonnet 4.5
Anthropic descriu Sonnet 4.5 com a model més potent en àrees crítiques: construcció d'agents complexos, generació i manteniment de codi i control de l'ordinador . No es queda només a l'etiqueta; la companyia assegura millores clares en raonament i matemàtiques, dos pilars que marquen la diferència quan els projectes impliquen múltiples passos i dependències.
Un dels titulars més cridaners és la seva capacitat per sostenir tasques complexes durant més de 30 hores seguides, mantenint el focus sense intervenció directa. En un pla pràctic, això es tradueix que un agent pot persistir en treballs llargs i coordinats sense perdre el fil. A més, el model admet sortides de fins a 64.000 tokens, cosa molt útil per a planificació detallada i generació de blocs de codi extensos.
A benchmarks públics, Anthropic afirma que Sonnet 4.5 és estat de l'art a SWE-bench Verified, una avaluació que mesura la resolució de problemes reals de programari. També destaca a OSWorld amb un 61,4%, cosa que indica avenços notables en tasques reals en entorns d'escriptori . La companyia mateixa compara aquest 61,4% amb el 42,2% que va obtenir Sonnet 4 fa uns mesos, una pujada que no és trivial.
Més enllà del rendiment brut, la casa subratlla que és el seu model «de frontera» més alineat: s'han reduït comportaments preocupants com l'adulació excessiva, la recerca de poder o la tendència a donar suport a raonaments delirants , i s'ha reforçat la defensa contra atacs de prompt injection en escenaris d'ús de l'ordinador i agents de capacitat.

Novetats a l'ecosistema: Claude Code, apps i plataforma
Sonnet 4.5 arriba acompanyat d'una gran actualització de producte. A Claude Code s'introdueixen els checkpoints (punts de control) , una de les funcions més demanades: guarden el progrés i permeten tornar a estats anteriors a l'instant. Per a qualsevol que desenvolupi amb iteracions llargues, aquest canvi redueix friccions i dóna confiança per explorar camins sense por de trencar-ho tot.
A això s'hi suma un rentat de cara de la interfície de terminal i el llançament d'una extensió nativa per a Visual Studio Code , amb la idea d'integrar Claude directament a l'IDE on viu el dia a dia del programador. Una empenta rellevant si es pretén que el model prengui un paper més operatiu i menys perifèric.
Pel costat de l'API, hi ha dues peces clau: edició de context i una nova eina de memòria per emmagatzemar i consultar informació . En conjunt, això permet executar agents més temps, filtrant context obsolet i mantenint accessible allò que de veritat importa, cosa essencial quan els fluxos de treball duren hores i els requisits canvien sobre la marxa.
A les apps de Claude, una altra novetat important: l'execució de codi i la creació d'arxius (documents, fulls de càlcul i presentacions) dins de la conversa. Això habilita que el model analitzi dades, generi contingut i el materialitzi en formats d'oficina sense sortir del xat, apropant teoria i pràctica al mateix fil.
Finalment, l'extensió oficial de Claude per a Chrome està disponible per als usuaris Max que es van unir a la llista d'espera, obrint la porta a automatitzar tasques de navegador amb menys fricció i més fiabilitat.
Claude Agent SDK: els pilars per construir els teus propis agents
Anthropic no es limita a ensenyar què pot fer el seu producte estrella; també ofereix les peces perquè altres ho construeixin a mida. El nou Claude Agent SDK comparteix la infraestructura que fa possible Claude Code, i està pensat per abordar problemes durs: gestió de memòria en tasques de llarga durada, sistemes de permisos que equilibrin autonomia amb control de l'usuari i coordinació entre subagents que treballen cap a un objectiu comú.
La proposta és convertir aquest SDK en una base reutilitzable, de manera que qualsevol equip pugui aixecar el seu propi agent sobre eines provades en producció . Anthropic sosté que, encara que va néixer per a casos de codi, mostra beneficis en una varietat molt àmplia de tasques.
Vista prèvia de recerca: «Imagina amb Claude»
Al costat de Sonnet 4.5, Anthropic ofereix una experiència temporal anomenada «Imagina amb Claude». En aquest experiment, el model genera programari sobre la marxa sense funcionalitats predeterminades i reacciona a la interacció de l'usuari en temps real. És, en essència, una finestra a què s'obre quan es combina un model capaç amb una infraestructura adequada.
La vista prèvia està disponible durant cinc dies per a subscriptors Max i s'hi accedeix des de claude.ai/imagine. La companyia ho planteja com un aparador lúdic però revelador de fins on pot arribar Sonnet 4.5 en generació i adaptació.
Seguretat, alineament i nivell ASL-3
El desplegament de Sonnet 4.5 s'empara al nivell de seguretat ASL-3, un marc ajustant capacitats del model amb salvaguardes apropiades . Entre les mesures figuren classificadors que busquen detectar entrades i sortides potencialment perilloses, amb focus en àmbits CBRN (químic, biològic, radiològic i nuclear).
Anthropic reconeix que aquests classificadors poden de vegades marcar continguts legítims, i per no interrompre l'usuari ofereix seguir la conversa amb Sonnet 4, que presenta menys risc CBRN. Des que van descriure per primera vegada aquests filtres han reduït els falsos positius per un factor de deu, i des del llançament de Claude Opus 4 al maig, per un factor de dos. La promesa és que la discernibilitat dels classificadors segueix millorant.
L'alineació va més enllà de filtres: l'entrenament i les avaluacions de seguretat inclouen per primer cop proves inspirades en interpretabilitat mecanicista , amb l'objectiu d'entendre i controlar millor el comportament intern del model. A més, s'han reforçat defenses davant de prompt injection, especialment rellevants quan el sistema navega, opera en escriptoris virtuals o executa accions.
Disponibilitat, integració i preus
Claude Sonnet 4.5 està disponible per tot arreu avui. Els desenvolupadors poden utilitzar-lo a través de la Claude API invocant el model «claude-sonnet-4-5» . El preu es manté respecte a la generació anterior: 3 dòlars per milió de tokens dentrada i 15 dòlars per milió de tokens de sortida.
Anthropic afegeix avantatges de cost amb la seva infraestructura: fins a un 90% d'estalvi amb memòria cau de prompts i un 50% addicional amb processament per lots, xifres pensades per a càrregues de treball de volum alt. Per a usuaris finals, es pot xatejar amb Sonnet 4.5 a Claude.ai (web, iOS i Android), i per a empreses està disponible de forma nativa a la Claude Developer Platform, a més d'Amazon Bedrock i Google Cloud Vertex AI.
Al plànol comercial, s'esmenta un pla gratuït amb límit de sessions que es reinicia cada cinc hores i un nombre variable de missatges segons demanda. I per a tasques de programació complexes, Claude Code actua com a agent líder de la casa.
Casos d'ús destacats
Sonnet 4.5 es presenta com el model idoni per a agents: podeu respondre gairebé a l'instant o desplegar pensament pas a pas visible quan la tasca ho exigeix. Els usuaris d'API controlen amb precisió quant de temps es pensa el model, triant entre rapidesa i profunditat.
En desenvolupament de programari, cobreix el cicle complet: planificació, generació, manteniment, correcció derrors i refactoritzacions de gran envergadura . El context de sortida ampli (fins a 64K tokens) facilita la producció de plans i codi extensos coherents.
En ús de navegador i ordinador, lidera la seva categoria: completa fluxos reals des d'anàlisi competitiva i compres fins a onboarding de clients a la web. La intenció és que la precisió i la fiabilitat continuïn millorant amb el temps.
En ciberseguretat, els equips que combinen Sonnet 4.5 amb Claude Code poden desplegar agents que fan pegats de vulnerabilitats de manera autònoma abans que siguin explotades, movent el focus des de la detecció reactiva cap a la defensa proactiva.
En finances, el model aborda anàlisis d'entrada i prediccions complexes ; per exemple, monitoritza canvis reguladors globals i adapta sistemes de compliment de forma preventiva, evolucionant de la preparació manual d'auditories a la gestió intel·ligent del risc.
En productivitat de negoci, destaca creant i editant fitxers d'oficina (documents, fulls, presentacions) . I en investigació, pot rastrejar fonts internes i externes per sintetitzar coneixements en paisatges informatius complexos.
En contingut, sobresurt escrivint amb comprensió del matís i el to, generant textos més convincents i analitzant en un nivell semàntic més profund , un punt valuós per a màrqueting, documentació tècnica o comunicació corporativa.
Rendiment i mètriques
Les dades que presenta Anthropic situen Sonnet 4.5 en 77,2% a SWE-bench Verified , el seu millor registre fins avui en programació. A OSWorld arriba al 61,4%, consolidant-ho com el seu millor model «computer-using». Aquestes mètriques vénen acompanyades del testimoni operacional de tasques de més de 30 hores i la capacitat de sortida de 64K tokens.
La companyia afirma que Sonnet 4.5 potencia agents en sectors d'alta exigència com ara anàlisi financera, ciberseguretat i investigació , coordinant diversos agents i processant grans volums de dades amb la fiabilitat que aquests dominis demanen.
Evolució de la família Sonnet i el lloc de 4.5
Per entendre el salt, cal mirar enrere. Sonnet 3.7 va introduir un model de raonament híbrid que va millorar de manera notable la codificació, la generació de continguts i l'anàlisi de dades. Després, Sonnet 4 va consolidar aquest enfocament amb un rendiment de frontera pràctic per a assistents dusuari i tasques dalt volum.
Sonnet 4.5 es recolza en aquesta trajectòria i la porta un pas més enllà: la seva ambició és ser l' opció més precisa per a tasques llargues, agents complexos i ús de l'ordinador , amb més coneixement de domini en programació, finances i ciberseguretat.
El que diuen els casos reals i la comunitat
Anthropic ha explicat que van posar Sonnet 4.5 a treballar durant 30 hores seguides per construir una rèplica de Slack . Segons la companyia, l'agent va generar 11.000 línies de codi sense supervisió i es va detenir en completar la tasca. Al maig, el seu model Opus 4 havia arribat a operar unes set hores, de manera que la nova marca multiplica aquest registre.
La història sona potent, però fora del material promocional emergeixen matisos. Desenvolupadors com @midudev relaten que el model va refactoritzar projectes sencers en una sola instrucció —aplicant patrons com a arquitectura neta i generant centenars o milers de línies— , però el resultat no funcionava en compilar. Altres reporten el mateix: codi amb estructura impecable i aparença professional, encara que trencat en execució.
També s'ha subratllat que Anthropic no ha mostrat la suposada app de Slack operant de principi a fi, sinó que ha explicat que la va construir, una distància important entre comunicar i demostrar amb codi verificable . Aquest patró no és exclusiu: a tota la indústria, els models milloren generant codi que sembla molt bo, però continuen fallant sovint a produir solucions funcionals sense intervenció humana significativa.
Des de dins, l'empresa explica que les millores van sorprendre el propi equip. Dianne Penn apunta que el model és tres vegades més hàbil usant ordinadors que la versió d'octubre i que el darrer mes han treballat amb feedback de GitHub i Cursor . Canva, com a beta tester, diu que ajuda amb «tasques complexes de llarg context». Scott White ho compara amb el nivell d'un cap de gabinet: coordina agendes, analitza dades i redacta informes.
La lectura entre línies és clara: fins i tot amb un model fort, calen màquines virtuals, gestió de memòria i de context, suport multiagent i sistemes de permisos per portar a producció agents més fiables. Aquest és precisament el lloc que l'Agent SDK i les noves funcions de la plataforma intenten cobrir.
Competència i posicionament al mercat
El llançament de Sonnet 4.5 s'interpreta dins d'una pugna tensa: OpenAI avança amb la seva propera generació i Google insisteix amb Gemini , movent fitxes que obliguen a accelerar el pas. En aquest context, els agents de llarga durada, lús directe de lordinador i la programació autònoma són vectors on es disputa gran part del valor empresarial.
Qui convenci les companyies que pot automatitzar fluxos reals amb control i fiabilitat, capturarà llicències i desplegaments a gran escala . Anthropic aposta perquè la barreja d'un model potent i la infraestructura adequada —la seva— tanqui la bretxa entre demostracions i operació sostinguda.
Recomanacions d'adopció i de bones pràctiques
Si provaràs Sonnet 4.5 de debò, tingues present que l'autonomia no és gratis. Les accions que el model pot executar —llegir i modificar fitxers, moure dades, executar ordres , navegar— requereixen regles clares i supervisió. Activar sistemes de permisos, auditar logs i establir llindars d‟intervenció humana és crític per reduir riscos.
En fluxos de codi, els checkpoints de Claude Code i la memòria de l'API ajuden a iterar amb seguretat. Tot i així, convé automatitzar proves i pipelins de validació , i introduir el model en etapes controlades (des de tasques de baix impacte a components crítics) abans de delegar grans responsabilitats.
On llegir més i com començar
Anthropic recomana actualitzar Sonnet 4.5 en tots els usos: apps, API i Claude Code. Presenta el model com un reemplaçament directe amb millor rendiment al mateix preu . Les novetats de Claude Code estan disponibles per a tots els usuaris; les de la plataforma de desenvolupadors —inclòs l'Agent SDK— per a tot el col·lectiu developer; i l'execució de codi i creació d'arxius a les apps, a tots els plans de pagament.
Per a detalls tècnics i resultats d'avaluació, la companyia apunta al seu system card, pàgina del model i documentació , a més de publicacions d'enginyeria i un post de recerca en ciberseguretat. Qui vulgui experimentar amb generació de programari en temps real té durant uns dies Imagina amb Claude.
El retrat que deixen aquests anuncis és un model que puja el llistó en agents, codi i ús de l'ordinador, mentre reforça escalabilitat, seguretat i eines per a desenvolupadors. Cal veure fins a quin punt la pràctica acompanya la teoria, però hi ha signes concrets de maduresa i un pla consistent per tancar la bretxa entre el «parla bé» i el «fa bé».