Claude Sonnet 4.5: Agenti che programmano, usano computer e restano sulla buona strada

Ultimo aggiornamento: 6 ottobre 2025
  • Sonnet 4.5 supporta agenti durevoli, codice migliore e calcolo affidabile, con 64K token di output e un focus di oltre 30 ore.
  • Aggiornamenti di Claude Code (checkpoint, terminale, VS Code), aggiunta di memoria e modifica del contesto all'API e avvio dell'Agent SDK.
  • Fa progressi in termini di sicurezza (ASL-3, meno falsi positivi, difesa contro l'iniezione immediata) e ottiene buoni risultati in SWE-bench e OSWorld.
  • Disponibile su Claude.ai, API, Bedrock e Vertex AI, con prezzi da $ 3 a $ 15, con risparmi su caching e batching.

Modello di intelligenza artificiale per la programmazione e gli agenti

L'arrivo di Claude Sonnet 4.5 ha dato impulso al campo dell'intelligenza artificiale applicata agli agenti e allo sviluppo software, con promesse che spaziano dalla programmazione autonoma e dalla gestione dei computer a progressi concreti nel ragionamento e nella matematica. Anthropic lo presenta come il suo modello più performante fino ad oggi, con un obiettivo ben preciso: trasformare Claude in qualcosa di più di un semplice assistente conversazionale, spingendolo nel regno di un "agente che agisce".

Parallelamente, l'azienda sta rafforzando il proprio ecosistema con miglioramenti a Claude Code, nuovi strumenti per sviluppatori e un livello di sicurezza e allineamento più rigoroso. Il messaggio è ambizioso: il miglior modello per agenti, codice e utilizzo del calcolo , supportato da metriche come SWE-bench Verified e OSWorld, oltre a una suite di funzionalità progettate per facilitare attività a lungo termine e più complesse.

Cos'è Claude Sonnet 4.5 e cosa promette?

Anthropic descrive Sonnet 4.5 come il suo modello più potente in aree critiche: creazione di agenti complessi, generazione e manutenzione del codice e controllo del computer . Va oltre la semplice etichettatura; l'azienda afferma di aver riscontrato netti miglioramenti nel ragionamento e nella matematica, due pilastri che fanno la differenza quando i progetti prevedono molteplici fasi e dipendenze.

Una delle sue caratteristiche più sorprendenti è la capacità di portare a termine compiti complessi per oltre 30 ore consecutive, mantenendo la concentrazione senza intervento diretto. In termini pratici, ciò significa che un agente può perseverare in lavori lunghi e coordinati senza perdere la concentrazione. Inoltre, il modello supporta output fino a 64.000 token, il che è molto utile per la pianificazione dettagliata e la generazione di grandi blocchi di codice.

Nei benchmark pubblici, Anthropic afferma che Sonnet 4.5 è all'avanguardia in SWE-bench Verified, una valutazione che misura la capacità del software di risolvere problemi reali. Eccelle anche in OSWorld con un punteggio del 61,4%, indicando miglioramenti significativi negli ambienti desktop reali . L'azienda stessa confronta questo 61,4% con il 42,2% ottenuto da Sonnet 4 pochi mesi fa, un incremento considerevole.

Al di là delle pure prestazioni, l'azienda sottolinea che si tratta del suo modello "di frontiera" più in linea con i suoi obiettivi: comportamenti preoccupanti come l'eccessiva adulazione, la ricerca del potere o la tendenza a sostenere ragionamenti deliranti sono stati ridotti , e le difese contro gli attacchi di prompt injection negli scenari di utilizzo del computer e nelle capacità degli agenti sono state rafforzate.

Caratteristiche e casi d'uso di Claude Sonnet

Aggiornamenti dell'ecosistema: codice Claude, app e piattaforma

Sonnet 4.5 arriva con un importante aggiornamento del prodotto. Claude Code introduce i checkpoint , una delle funzionalità più richieste: salvano i progressi e consentono agli utenti di tornare istantaneamente allo stato precedente. Per chiunque sviluppi con iterazioni lunghe, questa modifica riduce gli attriti e offre la sicurezza di esplorare percorsi diversi senza il timore di compromettere tutto.

A ciò si aggiunge un'interfaccia del terminale riprogettata e il lancio di un'estensione nativa per Visual Studio Code , con l'obiettivo di integrare Claude direttamente nell'IDE in cui i programmatori trascorrono le loro giornate. Si tratta di un passo avanti significativo se l'obiettivo è che il modello assuma un ruolo più operativo e meno marginale.

Sul lato API, ci sono due componenti chiave: la modifica del contesto e un nuovo strumento di memoria per archiviare e recuperare le informazioni . Insieme, questi consentono agli agenti di funzionare più a lungo, filtrando il contesto obsoleto e mantenendo accessibili le informazioni realmente importanti, aspetto essenziale quando i flussi di lavoro durano ore e i requisiti cambiano in tempo reale.

  Espressioni regolari in JavaScript: un'introduzione

Nelle app di Claude, un'altra importante innovazione è la possibilità di eseguire codice e creare file (documenti, fogli di calcolo e presentazioni) direttamente all'interno della conversazione. Questo permette al modello di analizzare i dati, generare contenuti e produrli in formati professionali senza uscire dalla chat, unendo teoria e pratica nello stesso thread.

Finalmente, l'estensione ufficiale di Claude per Chrome è disponibile per gli utenti di Max che si sono iscritti alla lista d'attesa, aprendo la strada all'automazione delle attività del browser con maggiore semplicità e affidabilità.

Claude Agent SDK: gli elementi costitutivi per creare i tuoi agenti

Anthropic non si limita a mostrare le potenzialità del suo prodotto di punta, ma fornisce anche gli elementi costitutivi per consentirne la personalizzazione. Il nuovo SDK di Claude Agent condivide l'infrastruttura che alimenta Claude Code ed è progettato per affrontare problemi complessi: gestione della memoria per attività di lunga durata, sistemi di autorizzazione che bilanciano autonomia e controllo da parte dell'utente e coordinamento tra sub-agenti che lavorano per un obiettivo comune.

La proposta è di trasformare questo SDK in una base riutilizzabile, in modo che qualsiasi team possa creare il proprio agente utilizzando strumenti collaudati in produzione . Anthropic sostiene che, sebbene sia stato inizialmente sviluppato per applicazioni basate su codice, dimostra vantaggi in un'ampia gamma di attività.

Anteprima della ricerca: "Immagina con Claude"

Insieme a Sonnet 4.5, Anthropic offre un'esperienza temporanea chiamata "Imagine with Claude". In questo esperimento, il modello genera software al volo senza funzionalità predefinite , reagendo all'interazione dell'utente in tempo reale. Si tratta, in sostanza, di un'anteprima di ciò che si può ottenere quando un modello performante viene combinato con l'infrastruttura adeguata.

L'anteprima è disponibile per cinque giorni per gli abbonati a Max e può essere consultata all'indirizzo claude.ai/imagine. L'azienda la presenta come una dimostrazione ludica ma al contempo rivelatrice delle capacità di Sonnet 4.5 in termini di generazione e adattamento.

Sicurezza, allineamento e livello ASL-3

L'implementazione di Sonnet 4.5 è supportata dal livello di sicurezza ASL-3, un framework che adatta le capacità del modello con opportune misure di sicurezza . Queste misure includono classificatori progettati per rilevare input e output potenzialmente pericolosi, con particolare attenzione agli ambienti CBRN (chimici, biologici, radiologici e nucleari).

Anthropic riconosce che questi classificatori possono talvolta segnalare contenuti legittimi e, per evitare di interrompere l'utente, offre la possibilità di continuare la conversazione con Sonnet 4, che presenta un rischio CBRN inferiore. Da quando hanno descritto per la prima volta questi filtri, hanno ridotto i falsi positivi di un fattore dieci e, dal lancio di Claude Opus 4 a maggio, di un fattore due. Promettono che la capacità di discriminazione dei classificatori continuerà a migliorare.

L'allineamento va oltre i filtri: la formazione e le valutazioni di sicurezza ora includono, per la prima volta, test ispirati all'interpretabilità meccanicistica , con l'obiettivo di comprendere e controllare meglio il comportamento interno del modello. Inoltre, sono state rafforzate le difese contro l'iniezione di prompt, particolarmente rilevanti quando il sistema naviga, opera in desktop virtuali o esegue azioni.

Disponibilità, integrazione e prezzi

Claude Sonnet 4.5 è disponibile ovunque da oggi. Gli sviluppatori possono utilizzarlo tramite l'API di Claude richiamando il modello "claude-sonnet-4-5" . Il prezzo rimane invariato rispetto alla generazione precedente: 3 dollari per milione di token in entrata e 15 dollari per milione di token in uscita.

Anthropic offre vantaggi in termini di costi grazie alla sua infrastruttura: fino al 90% di risparmio con la cache immediata e un ulteriore 50% con l'elaborazione batch, valori pensati per carichi di lavoro ad alto volume. Per gli utenti finali, la chat è disponibile con Sonnet 4.5 in Claude.ai (web, iOS e Android), mentre per le aziende è disponibile nativamente sulla piattaforma per sviluppatori Claude, nonché su Amazon Bedrock e Google Cloud Vertex AI.

Sul fronte aziendale, è disponibile un piano gratuito con un limite di sessioni che si azzera ogni cinque ore e un numero variabile di messaggi su richiesta. Per le attività di programmazione complesse, Claude Code si conferma come il fornitore leader.

  L'ascesa delle batterie per i data center dell'IA: Trasformazione industriale ed energetica

Casi d'uso in primo piano

Sonnet 4.5 si presenta come il modello ideale per gli agenti: può rispondere quasi istantaneamente o implementare un processo di pensiero visibile e graduale quando il compito lo richiede. Gli utenti dell'API controllano con precisione la durata del processo di "riflessione" del modello, scegliendo tra velocità e profondità.

Nello sviluppo software, copre l'intero ciclo di vita: pianificazione, generazione, manutenzione, correzione di bug e refactoring su larga scala . L'ampio contesto di output (fino a 64 token) facilita la produzione di piani e codice coerenti ed esaustivi.

In termini di utilizzo su browser e desktop, è leader nella sua categoria: completa flussi di lavoro reali, dall'analisi della concorrenza e dagli acquisti all'onboarding dei clienti sul web. L'obiettivo è che la precisione e l'affidabilità continuino a migliorare nel tempo.

Nel campo della sicurezza informatica, i team che combinano Sonnet 4.5 con Claude Code possono implementare agenti in grado di correggere autonomamente le vulnerabilità prima che vengano sfruttate, spostando l'attenzione dal rilevamento reattivo alla difesa proattiva.

In ambito finanziario, il modello si occupa dell'analisi degli input e delle previsioni complesse ; ad esempio, monitora i cambiamenti normativi globali e adatta proattivamente i sistemi di conformità, evolvendo dalla preparazione manuale delle verifiche a una gestione intelligente del rischio.

Nell'ambito della produttività aziendale, eccelle nella creazione e modifica di file d'ufficio (documenti, fogli di calcolo, presentazioni) . E nella ricerca, è in grado di monitorare fonti interne ed esterne per sintetizzare la conoscenza in contesti informativi complessi.

In termini di contenuti, eccelle nella scrittura, dimostrando una profonda comprensione delle sfumature e del tono, generando testi più convincenti e analizzando a un livello semantico più profondo , un aspetto prezioso per il marketing, la documentazione tecnica o la comunicazione aziendale.

Prestazioni e metriche

I dati presentati da Anthropic collocano Sonnet 4.5 al 77,2% in SWE-bench Verified , la sua migliore performance di programmazione fino ad oggi. In OSWorld, raggiunge il 61,4%, consolidando la sua posizione come miglior modello "per l'utilizzo del computer". Queste metriche sono supportate da prove operative di attività che superano le 30 ore e una capacità di output di 64 token.

L'azienda afferma che Sonnet 4.5 potenzia gli operatori in settori esigenti come l'analisi finanziaria, la sicurezza informatica e la ricerca , consentendo loro di coordinare più operatori ed elaborare grandi volumi di dati con l'affidabilità richiesta da questi ambiti.

Evoluzione della famiglia Sonnet e il posto di 4.5

Per comprendere questo salto, dobbiamo guardare indietro. Sonnet 3.7 ha introdotto un modello di ragionamento ibrido che ha migliorato significativamente la codifica, la generazione di contenuti e l'analisi dei dati. Successivamente, Sonnet 4 ha consolidato questo approccio con prestazioni quasi al limite della praticità per gli assistenti utente e le attività ad alto volume.

Sonnet 4.5 si basa su questa traiettoria e la porta a un livello superiore: la sua ambizione è quella di essere la scelta più accurata per attività di lunga durata, agenti complessi e utilizzo del computer , con una maggiore conoscenza del dominio in programmazione, finanza e sicurezza informatica.

Cosa dicono i casi reali e la comunità

Anthropic ha annunciato di aver messo in funzione Sonnet 4.5 per 30 ore consecutive per costruire una replica di Slack . Secondo l'azienda, l'agente ha generato 11.000 righe di codice senza supervisione e si è arrestato al termine dell'attività. A maggio, il loro modello Opus 4 era riuscito a funzionare per circa sette ore, quindi il nuovo record supera di gran lunga quel primato.

La storia sembra avvincente, ma al di là del materiale promozionale emergono delle sfumature. Sviluppatori come @midudev raccontano di come il modello abbia rifattorizzato interi progetti con una singola istruzione, applicando pattern come la clean architecture e generando centinaia o migliaia di righe di codice , ma il risultato non funzionava in fase di compilazione. Altri riportano lo stesso problema: codice con una struttura impeccabile e un aspetto professionale, ma che non funzionava in fase di esecuzione.

È stato inoltre fatto notare che Anthropic non ha mostrato il funzionamento completo della presunta app per Slack, ma si è limitata ad affermare di averla sviluppata: una discrepanza significativa tra la comunicazione e la dimostrazione con codice verificabile . Questo schema non è un caso isolato: in tutto il settore, i modelli migliorano generando codice dall'aspetto impeccabile, ma spesso non riescono a produrre soluzioni funzionali senza un significativo intervento umano.

  Cos'è Google TPU v7 Ironwood e perché cambia l'intelligenza artificiale?

Dall'interno dell'azienda, i miglioramenti hanno sorpreso persino il team interno. Dianne Penn sottolinea che il modello è tre volte più abile nell'utilizzo dei computer rispetto alla versione di ottobre e che hanno trascorso l'ultimo mese lavorando con i feedback di GitHub e Cursor . Canva, in qualità di beta tester, afferma che è utile per "attività complesse e a lungo termine". Scott White lo paragona al "livello di un capo di gabinetto": coordinare gli orari, analizzare i dati e redigere report.

Il messaggio di fondo è chiaro: anche con un modello robusto, macchine virtuali, gestione della memoria e del contesto, supporto multi-agente e sistemi di autorizzazione sono ancora necessari per implementare agenti più affidabili in produzione. È proprio questa lacuna che l'SDK dell'agente e le nuove funzionalità della piattaforma mirano a colmare.

Concorrenza e posizionamento sul mercato

Il lancio di Sonnet 4.5 è visto come parte di una competizione serrata: OpenAI sta procedendo a ritmo serrato con la sua prossima generazione, mentre Google continua con Gemini , compiendo mosse che costringono tutti ad accelerare i propri sforzi. In questo contesto, gli agenti a lungo termine, l'utilizzo diretto del computer e la programmazione autonoma sono aree chiave in cui è in gioco gran parte del valore commerciale.

Chiunque riuscirà a convincere le aziende della possibilità di automatizzare flussi di lavoro reali con controllo e affidabilità si aggiudicherà licenze e implementazioni su larga scala . Anthropic ritiene che la combinazione di un modello efficace con l'infrastruttura adeguata – la propria – colmerà il divario tra le dimostrazioni e la piena operatività.

Raccomandazioni e buone pratiche per l'adozione

Se intendete seriamente utilizzare Sonnet 4.5, tenete presente che l'autonomia ha un costo. Le azioni che il modello è in grado di eseguire – leggere e modificare file, spostare dati, eseguire comandi e navigare – richiedono regole chiare e una supervisione costante. L'implementazione di sistemi di autorizzazione, la registrazione di log e la definizione di soglie per l'intervento umano sono fondamentali per mitigare i rischi.

Nei flussi di codice, i checkpoint e la memoria API di Claude Code aiutano a iterare in modo sicuro. Ciononostante, è consigliabile automatizzare i test e le pipeline di validazione e introdurre il modello in fasi controllate (da attività a basso impatto a componenti critici) prima di delegare responsabilità importanti.

Dove leggere di più e come iniziare

Anthropic consiglia di aggiornare a Sonnet 4.5 per tutti gli utilizzi: app, API e Claude Code. Presentano l'aggiornamento come una sostituzione diretta con prestazioni migliorate allo stesso prezzo . Le nuove funzionalità di Claude Code sono disponibili per tutti gli utenti; gli aggiornamenti alla piattaforma di sviluppo, incluso l'Agent SDK, sono disponibili per l'intera comunità di sviluppatori; e l'esecuzione del codice e la creazione di file nelle app sono incluse in tutti i piani a pagamento.

Per dettagli tecnici e risultati delle valutazioni, l'azienda rimanda alla scheda di sistema, alla pagina del modello e alla documentazione , nonché a pubblicazioni tecniche e a un articolo di ricerca sulla sicurezza informatica. Chiunque desideri sperimentare la generazione di software in tempo reale può provare "Imagine with Claude" per alcuni giorni.

Il quadro che emerge da questi annunci è quello di un modello che alza l'asticella in termini di agenti, codice e utilizzo dei computer, rafforzando al contempo scalabilità, sicurezza e strumenti per gli sviluppatori. Resta da vedere fino a che punto la pratica corrisponderà alla teoria, ma ci sono segnali concreti di maturità e un piano coerente per colmare il divario tra "parlare bene" e "fare bene".

Claudio 4-1
Articolo correlato:
Claude 4: Anthropic reinventa l'intelligenza artificiale con modelli avanzati per la programmazione e agenti autonomi