- Sonnet 4.5 ger hållbara agenter, bättre kod och pålitlig databehandling, med 64 000 utdatatokens och ett fokus på över 30 timmar.
- Claude Code uppdaterar (kontrollpunkter, terminal, VS Code), lägger till minnes- och kontextredigering till API:et och startar Agent SDK.
- Den förbättrar säkerheten (ASL-3, färre falska positiva resultat, försvar mot snabb injektion) och presterar bra i SWE-bench och OSWorld.
- Tillgängligt på Claude.ai, API, Bedrock och Vertex AI, med priser från 3 till 15 dollar, med besparingar för cachning och batchning.

Ankomsten av Claude Sonnet 4.5 har gett AI-applikationer inom agenter och mjukvaruutveckling en ny dimma, med löften som sträcker sig från autonom programmering och datorhantering till konkreta framsteg inom resonemang och matematik. Anthropic presenterar den som sin mest kapabla modell hittills, med ett mycket tydligt fokus: att förvandla Claude till mer än bara en konversationsassistent, och nu bli en "agent som agerar".
Parallellt stärker företaget sitt ekosystem med förbättringar av Claude Code, nya utvecklarverktyg och ett striktare säkerhets- och anpassningslager. Budskapet är ambitiöst: den bästa modellen för agenter, kod och datoranvändning , med stöd av mätvärden som SWE-bench Verified och OSWorld, utöver en uppsättning funktioner utformade för att underlätta långsiktiga och mer komplexa uppgifter.
Vad är Claude Sonnet 4.5 och vad lovar det?
Anthropic beskriver Sonnet 4.5 som sin mest kraftfulla modell inom kritiska områden: att bygga komplexa agenter, kodgenerering och underhåll samt datorstyrning . Den går utöver att bara använda etiketter; företaget hävdar tydliga förbättringar inom resonemang och matematik, två grundpelare som gör hela skillnaden när projekt involverar flera steg och beroenden.
En av dess mest slående egenskaper är dess förmåga att utföra komplexa uppgifter i över 30 timmar i sträck, och bibehålla fokus utan direkt ingripande. I praktiken innebär detta att en agent kan fortsätta med långa, koordinerade jobb utan att tappa greppet. Dessutom stöder modellen utdata på upp till 64 000 tokens, vilket är mycket användbart för detaljerad planering och generering av stora kodblock.
I offentliga benchmarks hävdar Anthropic att Sonnet 4.5 är toppmodern i SWE-bench Verified, en bedömning som mäter programvaras förmåga att lösa verkliga problem. Den utmärker sig också i OSWorld med en poäng på 61,4 %, vilket indikerar betydande förbättringar i verkliga skrivbordsmiljöer . Företaget jämför själva dessa 61,4 % med de 42,2 % som Sonnet 4 uppnådde för några månader sedan, en avsevärd ökning.
Utöver rå prestanda betonar företaget att det är deras mest anpassade "gränsmodell": oroande beteenden som överdrivet smicker, maktsökande eller tendensen att stödja vanföreställningar har minskats , och försvar mot snabba injektionsattacker i datoranvändningsscenarier och agentfunktioner har stärkts.

Ekosystemuppdateringar: Claude Code, appar och plattform
Sonnet 4.5 kommer med en större produktuppdatering. Claude Code introducerar kontrollpunkter , en av de mest efterfrågade funktionerna: de sparar framsteg och låter användare direkt återgå till tidigare tillstånd. För alla som utvecklar med långa iterationer minskar denna förändring friktionen och ger förtroendet att utforska olika vägar utan rädsla för att allt ska gå sönder.
Detta utöver ett omdesignat terminalgränssnitt och lanseringen av ett inbyggt tillägg för Visual Studio Code , med syftet att integrera Claude direkt i den IDE där programmerare tillbringar sina dagar. Detta är ett betydande steg framåt om målet är att modellen ska ta på sig en mer operativ och mindre perifer roll.
På API-sidan finns två nyckelkomponenter: kontextredigering och ett nytt minnesverktyg för att lagra och hämta information . Tillsammans gör dessa att agenter kan köras längre, filtrera bort inaktuell kontext och hålla det som verkligen är viktigt tillgängligt – avgörande när arbetsflöden varar i timmar och kraven ändras i farten.
I Claudes appar är en annan viktig innovation möjligheten att köra kod och skapa filer (dokument, kalkylblad och presentationer) inom konversationen. Detta gör att modellen kan analysera data, generera innehåll och producera det i Office-format utan att lämna chatten, vilket sammanför teori och praktik i samma tråd.
Äntligen är Claudes officiella Chrome-tillägg tillgängligt för Max-användare som har anmält sig till väntelistan, vilket öppnar dörren för att automatisera webbläsaruppgifter med mindre friktion och mer tillförlitlighet.
Claude Agent SDK: Byggstenarna för att bygga dina egna agenter
Anthropic visar inte bara upp vad deras flaggskeppsprodukt kan göra; den tillhandahåller också byggstenar för andra att anpassa den. Det nya Claude Agent SDK: et delar infrastrukturen som driver Claude Code och är utformat för att hantera svåra problem: minneshantering för långvariga uppgifter, behörighetssystem som balanserar autonomi med användarkontroll och samordning mellan underagenter som arbetar mot ett gemensamt mål.
Förslaget är att omvandla detta SDK till en återanvändbar grund, så att alla team kan bygga sin egen agent med hjälp av produktionsbeprövade verktyg . Anthropic hävdar att även om det ursprungligen utvecklades för kodbaserade applikationer, visar det fördelar inom ett brett spektrum av uppgifter.
Förhandsvisning av forskning: "Föreställ dig med Claude"
Vid sidan av Sonnet 4.5 erbjuder Anthropic en tillfällig upplevelse som kallas "Imagine with Claude". I detta experiment genererar modellen programvara i realtid utan förutbestämda funktioner och reagerar på användarinteraktion i realtid. Det är i huvudsak en glimt av vad som kan uppnås när en kapabel modell kombineras med rätt infrastruktur.
Förhandsvisningen är tillgänglig i fem dagar för Max-prenumeranter och kan nås på claude.ai/imagine. Företaget presenterar den som en lekfull men ändå avslöjande uppvisning av Sonnet 4.5:s möjligheter vad gäller generering och anpassning.
Säkerhet, inriktning och ASL-3-nivå
Implementeringen av Sonnet 4.5 stöds av säkerhetsnivån ASL-3, ett ramverk som justerar modellens funktioner med lämpliga skyddsåtgärder . Dessa åtgärder inkluderar klassificerare utformade för att upptäcka potentiellt farliga in- och utmatningar, med fokus på CBRN-miljöer (kemiska, biologiska, radiologiska och nukleära).
Anthropic erkänner att dessa klassificerare ibland kan flagga legitimt innehåll, och för att undvika att avbryta användaren erbjuder de sig att fortsätta samtalet med Sonnet 4, som har en lägre CBRN-risk. Sedan de först beskrev dessa filter har de minskat falska positiva resultat med en faktor tio, och sedan lanseringen av Claude Opus 4 i maj, med en faktor två. De lovar att klassificerarnas urskiljbarhet kommer att fortsätta att förbättras.
Anpassningen går bortom filter: utbildnings- och säkerhetsbedömningar inkluderar nu, för första gången, tester inspirerade av mekanistisk tolkningsbarhet , med målet att bättre förstå och kontrollera modellens interna beteende. Dessutom har försvar mot snabb injicering stärkts, vilket är särskilt relevant när systemet surfar, arbetar i virtuella skrivbord eller utför åtgärder.
Tillgänglighet, integration och prissättning
Claude Sonnet 4.5 är tillgänglig överallt idag. Utvecklare kan använda den via Claude API genom att anropa modellen "claude-sonnet-4-5" . Priset förblir detsamma som föregående generation: 3 dollar per miljon tokens in och 15 dollar per miljon tokens ut.
Anthropic erbjuder kostnadsfördelar med sin infrastruktur: upp till 90 % besparingar med snabb cachning och ytterligare 50 % med batchbehandling – siffror utformade för arbetsbelastningar med hög volym. För slutanvändare är chatt tillgängligt med Sonnet 4.5 i Claude.ai (webb, iOS och Android), och för företag är det tillgängligt direkt på Claude Developer Platform, samt Amazon Bedrock och Google Cloud Vertex AI.
På företagssidan finns ett gratisabonnemang med en sessionsgräns som återställs var femte timme och ett variabelt antal meddelanden på begäran. Och för komplexa programmeringsuppgifter agerar Claude Code som den ledande leverantören.
Utvalda användningsfall
Sonnet 4.5 presenteras som den ideala modellen för agenter: den kan reagera nästan omedelbart eller implementera synligt, stegvis tänkande när uppgiften kräver det. API-användare styr exakt hur länge modellen "tänker" och väljer mellan hastighet och djup.
Inom mjukvaruutveckling täcker det hela livscykeln: planering, generering, underhåll, buggfixar och storskalig refactoring . Den stora utdatakontexten (upp till 64 000 tokens) underlättar produktionen av konsekventa, omfattande planer och kod.
När det gäller webbläsar- och datoranvändning leder den sin kategori: den genomför verkliga arbetsflöden från konkurrensanalys och inköp till kundintroduktion på webben. Avsikten är att noggrannhet och tillförlitlighet ska fortsätta att förbättras över tid.
Inom cybersäkerhet kan team som kombinerar Sonnet 4.5 med Claude Code distribuera agenter som autonomt åtgärdar sårbarheter innan de utnyttjas, vilket flyttar fokus från reaktiv detektering till proaktivt försvar.
Inom finans hanterar modellen indataanalys och komplexa förutsägelser ; till exempel övervakar den globala regelförändringar och anpassar regelefterlevnadssystem proaktivt, och utvecklas från manuell revisionsförberedelse till intelligent riskhantering.
Inom affärsproduktivitet utmärker den sig i att skapa och redigera Office-filer (dokument, kalkylblad, presentationer) . Och inom forskning kan den spåra interna och externa källor för att syntetisera kunskap i komplexa informationslandskap.
Innehållsmässigt utmärker han sig i att skriva med förståelse för nyanser och ton, generera mer övertygande texter och analysera på en djupare semantisk nivå , en värdefull poäng för marknadsföring, teknisk dokumentation eller företagskommunikation.
Prestanda och mätvärden
Data som presenteras av Anthropic placerar Sonnet 4.5 på 77,2 % i SWE-bench Verified , dess bästa prestanda hittills inom programmering. I OSWorld når den 61,4 %, vilket befäster dess position som dess bästa "datoranvändande" modell. Dessa mätvärden stöds av operativa bevis på uppgifter som överstiger 30 timmar och en utdatakapacitet på 64 000 tokens.
Företaget uppger att Sonnet 4.5 ger agenter möjlighet att arbeta inom krävande sektorer som finansiell analys, cybersäkerhet och forskning , genom att koordinera flera agenter och bearbeta stora datamängder med den tillförlitlighet som dessa områden kräver.
Sonnet-familjens utveckling och platsen för 4.5
För att förstå detta språng måste vi se tillbaka. Sonnet 3.7 introducerade en hybrid resonemangsmodell som avsevärt förbättrade kodning, innehållsgenerering och dataanalys. Sedan befäste Sonnet 4 den metoden med nästan gränsfallsprestanda som är praktisk för användarassistenter och högvolymsuppgifter.
Sonnet 4.5 bygger vidare på den utvecklingen och tar den ett steg längre: ambitionen är att vara det mest exakta valet för långa uppgifter, komplexa agenter och datoranvändning , med större domänkunskap inom programmering, ekonomi och cybersäkerhet.
Vad verkliga fall och samhället säger
Anthropic har rapporterat att de lät Sonnet 4.5 arbeta i 30 timmar i sträck för att bygga en replika av Slack . Enligt företaget genererade agenten 11 000 rader kod utan övervakning och stoppade när uppgiften var slutförd. I maj hade deras Opus 4-modell lyckats fungera i cirka sju timmar, så det nya rekordet slår vida den nivån.
Berättelsen låter kraftfull, men nyanser framträder utanför reklammaterialet. Utvecklare som @midudev berättar hur modellen omstrukturerade hela projekt i en enda instruktion – tillämpade mönster som ren arkitektur och genererade hundratals eller tusentals rader – men resultatet fungerade inte vid kompilering. Andra rapporterar samma sak: kod med oklanderlig struktur och ett professionellt utseende, men trasig vid körning.
Det har också påpekats att Anthropic inte har visat att den påstådda Slack-appen fungerar från början till slut, utan snarare har uppgett att de byggde den – ett betydande gap mellan att kommunicera och demonstrera med verifierbar kod . Detta mönster är inte unikt: inom hela branschen förbättras modeller genom att generera kod som ser väldigt bra ut, men de misslyckas fortfarande ofta med att producera funktionella lösningar utan betydande mänsklig inblandning.
Inom företaget överraskade förbättringarna till och med deras eget team. Dianne Penn påpekar att modellen är tre gånger mer skicklig på att använda datorer än oktoberversionen och att de har tillbringat den senaste månaden med att arbeta med feedback från GitHub och Cursor . Canva, som betatestare, säger att det hjälper med "komplexa uppgifter med lång kontext". Scott White jämför det med "en stabschefs nivå": att koordinera scheman, analysera data och skriva rapporter.
Det underliggande budskapet är tydligt: även med en robust modell behövs fortfarande virtuella maskiner, minnes- och kontexthantering, stöd för flera agenter och behörighetssystem för att driftsätta mer tillförlitliga agenter i produktion. Det är just detta gap som Agent SDK och plattformens nya funktioner syftar till att fylla.
Konkurrens och marknadspositionering
Lanseringen av Sonnet 4.5 ses som en del av en hård konkurrens: OpenAI går vidare med sin nästa generation, medan Google fortsätter med Gemini och gör drag som tvingar alla att accelerera sina ansträngningar. I detta sammanhang är långsiktiga agenter, direkt datoranvändning och autonom programmering viktiga områden där mycket av affärsvärdet står på spel.
Den som övertygar företag om att de kan automatisera verkliga arbetsflöden med kontroll och tillförlitlighet kommer att vinna licenser och storskaliga implementeringar . Anthropic tror att kombinationen av en kraftfull modell med rätt infrastruktur – deras egen – kommer att överbrygga klyftan mellan demonstrationer och hållbar drift.
Rekommendationer och god praxis för införande
Om du ska testa Sonnet 4.5 på allvar, kom ihåg att autonomi inte kommer utan pris. De åtgärder som modellen kan utföra – läsa och modifiera filer, flytta data, köra kommandon och navigera – kräver tydliga regler och tillsyn. Att aktivera behörighetssystem, granska loggar och fastställa tröskelvärden för mänsklig intervention är avgörande för att minska risker.
I kodflöden hjälper Claude Codes kontrollpunkter och API-minne till att iterera säkert. Trots detta är det lämpligt att automatisera tester och valideringspipelines , och introducera modellen i kontrollerade steg (från uppgifter med låg påverkan till kritiska komponenter) innan större ansvarsområden delegeras.
Var man kan läsa mer och hur man kommer igång
Anthropic rekommenderar att man uppgraderar till Sonnet 4.5 för alla användningsområden: appar, API:er och Claude Code. De presenterar uppgraderingen som en direkt ersättning med förbättrad prestanda till samma pris . Nya funktioner i Claude Code är tillgängliga för alla användare; uppdateringar till utvecklarplattformen – inklusive Agent SDK – är tillgängliga för hela utvecklarcommunityn; och kodkörning och filskapande i appar ingår i alla betalda planer.
För tekniska detaljer och utvärderingsresultat hänvisar företaget till sitt systemkort, modellsida och dokumentation , samt tekniska publikationer och ett forskningsinlägg om cybersäkerhet. Den som vill experimentera med realtidsgenerering av programvara kan prova "Imagine with Claude" i några dagar.
Bilden som målas upp av dessa tillkännagivanden är en modell som höjer ribban vad gäller agenter, kod och datoranvändning, samtidigt som den stärker skalbarhet, säkerhet och utvecklarverktyg. Det återstår att se i vilken utsträckning praktiken kommer att matcha teorin, men det finns konkreta tecken på mognad och en konsekvent plan för att överbrygga klyftan mellan att "prata gott" och att "göra gott".