Claude Sonnet 4.5: Agenter der programmerer, bruger computere og holder sig på sporet

Sidste ændring: 6 oktober 2025
Forfatter: TecnoDigital
  • Sonnet 4.5 leverer holdbare agenter, bedre kode og pålidelig databehandling med 64K outputtokens og et fokus på over 30 timer.
  • Claude Code opdaterer (checkpoints, terminal, VS Code), tilføjer hukommelses- og kontekstredigering til API'en og lancerer Agent SDK'et.
  • Den forbedrer sikkerheden (ASL-3, færre falske positiver, forsvar mod prompt injection) og klarer sig godt i SWE-bench og OSWorld.
  • Tilgængelig på Claude.ai, API, Bedrock og Vertex AI, med priser fra $3 til $15, med besparelser på caching og batching.

AI-model til programmering og agenter

Ankomsten af ​​Claude Sonnet 4.5 har sat gang i feltet AI anvendt til agenter og softwareudvikling, med løfter lige fra autonom programmering og computerhåndtering til håndgribelige fremskridt inden for ræsonnement og matematik. Anthropic præsenterer den som sin hidtil mest kapable model med et meget klart fokus: at transformere Claude til mere end blot en samtaleassistent og skubbe den ind i verdenen af ​​en "agent, der handler".

Parallelt styrker virksomheden sit økosystem med forbedringer af Claude Code, nye udviklerværktøjer og et strengere sikkerheds- og justeringslag. Budskabet er ambitiøst: den bedste model for agenter, kode og computerbrug , understøttet af metrikker som SWE-bench Verified og OSWorld, foruden en række funktioner designet til at lette langsigtede og mere komplekse opgaver.

Hvad er Claude Sonnet 4.5, og hvad lover det?

Anthropic beskriver Sonnet 4.5 som sin mest kraftfulde model inden for kritiske områder: opbygning af komplekse agenter, kodegenerering og -vedligeholdelse samt computerstyring . Det går ud over blot mærkning; virksomheden hævder klare forbedringer inden for ræsonnement og matematik, to søjler, der gør hele forskellen, når projekter involverer flere trin og afhængigheder.

En af dens mest slående funktioner er dens evne til at udføre komplekse opgaver i over 30 timer i træk og bevare fokus uden direkte indgriben. I praksis betyder det, at en agent kan fortsætte med lange, koordinerede opgaver uden at miste overblikket. Desuden understøtter modellen output på op til 64.000 tokens, hvilket er meget nyttigt til detaljeret planlægning og generering af store kodeblokke.

I offentlige benchmarks hævder Anthropic, at Sonnet 4.5 er state-of-the-art i SWE-bench Verified, en vurdering, der måler softwares evne til at løse virkelige problemer. Den udmærker sig også i OSWorld med en score på 61,4%, hvilket indikerer betydelige forbedringer i virkelige skrivebordsmiljøer . Virksomheden sammenligner selv disse 61,4% med de 42,2%, som Sonnet 4 opnåede for et par måneder siden, en betydelig stigning.

Ud over rå ydeevne understreger virksomheden, at det er dens mest afstemte "grænse"-model: bekymrende adfærd såsom overdreven smiger, magtsøgning eller tendensen til at understøtte vrangforestillinger er blevet reduceret , og forsvaret mod prompte injektionsangreb i computerbrugsscenarier og agentfunktioner er blevet styrket.

Claude Sonnets funktioner og brugsscenarier

Økosystemopdateringer: Claude Code, apps og platform

Sonnet 4.5 kommer med en større produktopdatering. Claude Code introducerer checkpoints , en af ​​de mest efterspurgte funktioner: de gemmer fremskridt og giver brugerne mulighed for øjeblikkeligt at vende tilbage til tidligere tilstande. For alle, der udvikler med lange iterationer, reducerer denne ændring friktion og giver tillid til at udforske forskellige veje uden frygt for at ødelægge alt.

Dette kommer oven i en nydesignet terminalgrænseflade og lanceringen af ​​en native udvidelse til Visual Studio Code med det formål at integrere Claude direkte i den IDE, hvor programmører tilbringer deres dage. Dette er et betydeligt skridt fremad, hvis målet er, at modellen skal påtage sig en mere operationel og mindre perifer rolle.

På API-siden er der to nøglekomponenter: kontekstredigering og et nyt hukommelsesværktøj til lagring og hentning af information . Sammen giver disse agenter mulighed for at køre længere, filtrere gammel kontekst fra og holde det, der virkelig betyder noget, tilgængeligt – afgørende, når arbejdsgange varer i timevis, og kravene ændrer sig undervejs.

  Sådan opretter du WhatsApp-klistermærker med ChatGPT og AI-værktøjer: Komplet vejledning

I Claudes apps er en anden vigtig innovation muligheden for at køre kode og oprette filer (dokumenter, regneark og præsentationer) i samtalen. Dette gør det muligt for modellen at analysere data, generere indhold og producere det i Office-formater uden at forlade chatten, hvilket bringer teori og praksis sammen i den samme tråd.

Endelig er Claudes officielle Chrome-udvidelse tilgængelig for Max-brugere, der har tilmeldt sig ventelisten, hvilket åbner døren for at automatisere browseropgaver med mindre friktion og mere pålidelighed.

Claude Agent SDK: Byggestenene til at bygge dine egne agenter

Anthropic viser ikke blot, hvad deres flagskibsprodukt kan; det leverer også byggestenene, som andre kan bruge til at tilpasse det. Det nye Claude Agent SDK deler den infrastruktur, der driver Claude Code, og er designet til at håndtere vanskelige problemer: hukommelsesstyring til langvarige opgaver, tilladelsessystemer, der balancerer autonomi med brugerkontrol, og koordinering mellem underagenter, der arbejder hen imod et fælles mål.

Forslaget er at omdanne dette SDK til et genanvendeligt fundament, så ethvert team kan bygge deres egen agent ved hjælp af produktionsafprøvede værktøjer . Anthropic fastholder, at selvom det oprindeligt blev udviklet til kodebaserede applikationer, demonstrerer det fordele på tværs af en bred vifte af opgaver.

Forskningsforhåndsvisning: "Forestil dig med Claude"

Sammen med Sonnet 4.5 tilbyder Anthropic en midlertidig oplevelse kaldet "Imagine with Claude". I dette eksperiment genererer modellen software on-the-fly uden forudbestemte funktionaliteter og reagerer på brugerinteraktion i realtid. Det er i bund og grund et glimt af, hvad der kan opnås, når en kapabel model kombineres med den rigtige infrastruktur.

Forhåndsvisningen er tilgængelig i fem dage for Max-abonnenter og kan tilgås på claude.ai/imagine. Virksomheden præsenterer den som en legende, men afslørende præsentation af Sonnet 4.5's muligheder med hensyn til generering og tilpasning.

Sikkerhed, justering og ASL-3-niveau

Implementeringen af ​​Sonnet 4.5 understøttes af sikkerhedsniveauet ASL-3, et rammeværk, der justerer modellens funktioner med passende sikkerhedsforanstaltninger . Disse foranstaltninger omfatter klassifikatorer designet til at detektere potentielt farlige input og output, med fokus på CBRN-miljøer (kemiske, biologiske, radiologiske og nukleare).

Anthropic anerkender, at disse klassifikatorer nogle gange kan markere legitimt indhold, og for at undgå at afbryde brugeren tilbyder de at fortsætte samtalen med Sonnet 4, som udgør en lavere CBRN-risiko. Siden de først beskrev disse filtre, har de reduceret falske positiver med en faktor ti, og siden lanceringen af ​​Claude Opus 4 i maj med en faktor to. De lover, at klassifikatorernes skelneevne fortsat vil blive forbedret.

Tilpasningen går ud over filtre: Trænings- og sikkerhedsvurderinger inkluderer nu for første gang tests inspireret af mekanistisk fortolkningsevne med det formål bedre at forstå og kontrollere modellens interne adfærd. Derudover er forsvaret mod prompt injection blevet styrket, hvilket er særligt relevant, når systemet browser, kører på virtuelle skriveborde eller udfører handlinger.

Tilgængelighed, integration og prisfastsættelse

Claude Sonnet 4.5 er tilgængelig overalt i dag. Udviklere kan bruge den via Claude API'en ved at kalde modellen "claude-sonnet-4-5" . Prisen forbliver den samme som den forrige generation: $3 pr. million tokens ind og $15 pr. million tokens ud.

Anthropic tilbyder omkostningsfordele med sin infrastruktur: op til 90% besparelser med hurtig caching og yderligere 50% med batchbehandling – tal designet til store arbejdsbelastninger. For slutbrugere er chat tilgængelig med Sonnet 4.5 i Claude.ai (web, iOS og Android), og for virksomheder er det tilgængeligt på Claude Developer Platform, samt Amazon Bedrock og Google Cloud Vertex AI.

På erhvervssiden er der et gratis abonnement med en sessionsgrænse, der nulstilles hver femte time , og et variabelt antal beskeder efter behov. Og til komplekse programmeringsopgaver fungerer Claude Code som den førende udbyder.

  Sådan bruger du DeepMind og forstår du dens reelle indflydelse på AI

Udvalgte brugstilfælde

Sonnet 4.5 præsenteres som den ideelle model for agenter: den kan reagere næsten øjeblikkeligt eller implementere synlig, trinvis tænkning, når opgaven kræver det. API-brugere styrer præcist, hvor længe modellen "tænker", og vælger mellem hastighed og dybde.

Inden for softwareudvikling dækker det hele livscyklussen: planlægning, generering, vedligeholdelse, fejlrettelser og storstilet refactoring . Den store outputkontekst (op til 64K tokens) letter produktionen af ​​ensartede, omfattende planer og kode.

Med hensyn til browser- og desktopbrug er den førende i sin kategori: den fuldfører virkelige arbejdsgange fra konkurrenceanalyse og indkøb til kundeonboarding på nettet. Intentionen er, at nøjagtighed og pålidelighed fortsat vil forbedres over tid.

Inden for cybersikkerhed kan teams, der kombinerer Sonnet 4.5 med Claude Code, implementere agenter, der autonomt retter sårbarheder, før de udnyttes, hvilket flytter fokus fra reaktiv detektion til proaktivt forsvar.

Inden for finanssektoren omhandler modellen inputanalyse og komplekse forudsigelser ; for eksempel overvåger den globale regulatoriske ændringer og tilpasser compliance-systemer proaktivt, og udvikler sig fra manuel revisionsforberedelse til intelligent risikostyring.

Inden for forretningsproduktivitet udmærker den sig ved at oprette og redigere Office-filer (dokumenter, regneark, præsentationer) . Og inden for forskning kan den spore interne og eksterne kilder for at syntetisere viden i komplekse informationslandskaber.

Indholdsmæssigt udmærker han sig ved at skrive med forståelse for nuancer og tone, generere mere overbevisende tekster og analysere på et dybere semantisk niveau , et værdifuldt punkt for marketing, teknisk dokumentation eller virksomhedskommunikation.

Ydeevne og målinger

Dataene præsenteret af Anthropic placerer Sonnet 4.5 på 77,2% i SWE-bench Verified , dens hidtil bedste præstation inden for programmering. I OSWorld når den 61,4%, hvilket cementerer dens position som den bedste "computerbrugende" model. Disse målinger understøttes af operationelle beviser for opgaver, der overstiger 30 timer, og en outputkapacitet på 64 tokens.

Virksomheden oplyser, at Sonnet 4.5 styrker agenter i krævende sektorer som finansiel analyse, cybersikkerhed og forskning , koordinerer flere agenter og behandler store datamængder med den pålidelighed, som disse domæner kræver.

Sonnet-familiens udvikling og 4.5's plads

For at forstå dette spring, er vi nødt til at se tilbage. Sonnet 3.7 introducerede en hybrid ræsonnementmodel , der forbedrede kodning, indholdsgenerering og dataanalyse betydeligt. Derefter cementerede Sonnet 4 denne tilgang med næsten grænseoverskridende ydeevne, der er praktisk for brugerassistenter og opgaver med stor volumen.

Sonnet 4.5 bygger videre på den udvikling og tager den et skridt videre: Ambitionen er at være det mest præcise valg til lange opgaver, komplekse agenter og computerbrug med større domæneviden inden for programmering, finans og cybersikkerhed.

Hvad virkelige tilfælde og samfundet siger

Anthropic har rapporteret, at de satte Sonnet 4.5 i gang i 30 sammenhængende timer for at bygge en kopi af Slack . Ifølge virksomheden genererede agenten 11.000 linjer kode uden opsyn og stoppede, da opgaven var fuldført. I maj havde deres Opus 4-model formået at køre i omkring syv timer, så den nye rekord overgår langt dette mål.

Historien lyder stærk, men nuancer dukker op uden for reklamematerialet. Udviklere som @midudev fortæller, hvordan modellen refaktorerede hele projekter i en enkelt instruktion – anvendte mønstre som ren arkitektur og genererede hundredvis eller tusindvis af linjer – men resultatet fungerede ikke under kompilering. Andre rapporterer det samme: kode med upåklagelig struktur og et professionelt udseende, men ødelagt under kørsel.

Det er også blevet påpeget, at Anthropic ikke har vist, at den påståede Slack-app fungerer fra start til slut, men snarere har angivet, at de har bygget den – en betydelig kløft mellem kommunikation og demonstration med verificerbar kode . Dette mønster er ikke enestående: I hele branchen forbedres modeller ved at generere kode, der ser rigtig godt ud, men de formår stadig ofte ikke at producere funktionelle løsninger uden betydelig menneskelig indgriben.

  Sådan installerer og bruger du LM Studio på Windows og Mac

Internt i virksomheden overraskede forbedringerne selv deres eget team. Dianne Penn påpeger, at modellen er tre gange bedre til at bruge computere end oktoberversionen, og at de har brugt den sidste måned på at arbejde med feedback fra GitHub og Cursor . Canva siger, som betatester, at det hjælper med "komplekse opgaver med lang kontekst". Scott White sammenligner det med "en stabschefs niveau": koordinering af tidsplaner, analyse af data og skrivning af rapporter.

Det underliggende budskab er klart: Selv med en robust model er virtuelle maskiner, hukommelses- og kontekststyring, multi-agent-support og tilladelsessystemer stadig nødvendige for at implementere mere pålidelige agenter i produktion. Det er netop det hul, som Agent SDK'et og platformens nye funktioner sigter mod at udfylde.

Konkurrence og markedspositionering

Lanceringen af ​​Sonnet 4.5 ses som en del af en intens konkurrence: OpenAI går videre med sin næste generation, mens Google fortsætter med Gemini og foretager træk, der tvinger alle til at accelerere deres indsats. I denne sammenhæng er langsigtede agenter, direkte computerbrug og autonom programmering nøgleområder, hvor en stor del af forretningsværdien står på spil.

Den, der overbeviser virksomheder om, at de kan automatisere arbejdsgange i den virkelige verden med kontrol og pålidelighed, vil sikre sig licenser og storstilede implementeringer . Anthropic mener, at kombinationen af ​​en kraftfuld model med den rigtige infrastruktur – deres egen – vil bygge bro mellem demonstrationer og vedvarende drift.

Anbefalinger og god praksis for implementering

Hvis du seriøst vil prøve Sonnet 4.5, skal du huske på, at autonomi ikke kommer uden en pris. De handlinger, modellen kan udføre – læse og ændre filer, flytte data, udføre kommandoer og navigere – kræver klare regler og tilsyn. Aktivering af tilladelsessystemer, revisionslogfiler og etablering af tærskler for menneskelig indgriben er afgørende for at afbøde risici.

I kodeflows hjælper Claude Codes checkpoints og API-hukommelse med sikker iteration. Alligevel er det tilrådeligt at automatisere test- og valideringspipelines og introducere modellen i kontrollerede faser (fra opgaver med lav effekt til kritiske komponenter), før større ansvarsområder delegeres.

Hvor kan man læse mere, og hvordan man kommer i gang

Anthropic anbefaler at opgradere til Sonnet 4.5 til alle anvendelser: apps, API'er og Claude Code. De præsenterer opgraderingen som en direkte erstatning med forbedret ydeevne til samme pris . Nye funktioner i Claude Code er tilgængelige for alle brugere; opdateringer til udviklerplatformen – inklusive Agent SDK – er tilgængelige for hele udviklerfællesskabet; og kodeudførelse og filoprettelse i apps er inkluderet i alle betalte abonnementer.

For tekniske detaljer og evalueringsresultater henviser virksomheden til sit systemkort, modelside og dokumentation , samt ingeniørpublikationer og et forskningsindlæg om cybersikkerhed. Enhver, der ønsker at eksperimentere med softwaregenerering i realtid, kan prøve "Imagine with Claude" i et par dage.

Det billede, der tegnes af disse annonceringer, er en model, der hæver barren for agenter, kode og computerbrug, samtidig med at den styrker skalerbarhed, sikkerhed og udviklerværktøjer. Det er endnu uvist, i hvilket omfang praksis vil matche teorien, men der er konkrete tegn på modenhed og en konsekvent plan for at bygge bro mellem "at tale godt" og "at gøre godt".

Claude 4-1
Relateret artikel:
Claude 4: Anthropic gentænker kunstig intelligens med avancerede modeller til programmering og autonome agenter