- Sonnet 4.5 omogoča vzdržljive agente, boljšo kodo in zanesljivo računalništvo s 64 tisoč izhodnimi žetoni in več kot 30 urami delovanja.
- Claude Code posodablja (kontrolne točke, terminal, VS Code), dodaja urejanje pomnilnika in konteksta v API ter zažene Agent SDK.
- Napreduje na področju varnosti (ASL-3, manj lažno pozitivnih rezultatov, zaščita pred takojšnjim vbrizgavanjem) in se dobro obnese v SWE-bench in OSWorld.
- Na voljo na platformah Claude.ai, API, Bedrock in Vertex AI, s cenami od 3 do 15 dolarjev, s prihranki za predpomnjenje in paketno obdelavo.

Prihod Claude Sonnet 4.5 je sprožil razmah na področju umetne inteligence, ki se uporablja za agente in razvoj programske opreme, z obljubami, ki segajo od avtonomnega programiranja in upravljanja z računalniki do oprijemljivega napredka v sklepanju in matematiki. Anthropic ga predstavlja kot svoj najzmogljivejši model doslej, z zelo jasnim ciljem: preoblikovati Claudea v več kot le pogovornega asistenta in ga potisniti v področje "agenta, ki deluje".
Vzporedno podjetje krepi svoj ekosistem z izboljšavami Claude Code, novimi orodji za razvijalce ter strožjo varnostno in poravnalno plastjo. Sporočilo je ambiciozno: najboljši model za uporabo agentov, kode in računalništva , podprt z metrikami, kot sta SWE-bench Verified in OSWorld, poleg tega pa še nabor funkcij, zasnovanih za lažje dolgoročne in bolj kompleksne naloge.
Kaj je Claude Sonnet 4.5 in kaj obljublja?
Anthropic opisuje Sonnet 4.5 kot svoj najmočnejši model na kritičnih področjih: gradnja kompleksnih agentov, generiranje in vzdrževanje kode ter računalniški nadzor . Gre dlje od zgolj označevanja; podjetje trdi, da gre za očitne izboljšave v sklepanju in matematiki, dveh stebrih, ki naredita vso razliko, ko projekti vključujejo več korakov in odvisnosti.
Ena njegovih najbolj presenetljivih lastnosti je sposobnost vzdrževanja kompleksnih nalog več kot 30 ur zapored, pri čemer ohranja osredotočenost brez neposrednega posredovanja. V praksi to pomeni, da lahko agent vztraja pri dolgih, usklajenih nalogah, ne da bi pri tem izgubil sled. Poleg tega model podpira izhode do 64.000 žetonov, kar je zelo uporabno za podrobno načrtovanje in ustvarjanje velikih blokov kode.
V javnih primerjalnih testih Anthropic trdi, da je Sonnet 4.5 najsodobnejši v SWE-bench Verified, oceni, ki meri sposobnost programske opreme za reševanje problemov iz resničnega sveta. Prav tako blesti v OSWorld z rezultatom 61,4 %, kar kaže na znatne izboljšave v resničnih namiznih okoljih . Podjetje samo primerja teh 61,4 % s 42,2 %, ki jih je Sonnet 4 dosegel pred nekaj meseci, kar je precejšnje povečanje.
Poleg surove zmogljivosti podjetje poudarja, da je to njihov najbolj usklajen "mejni" model: zaskrbljujoče vedenje, kot so pretirano laskanje, iskanje moči ali nagnjenost k podpiranju blodnjavih sklepov, se je zmanjšalo , obramba pred napadi s takojšnjim vbrizgavanjem v scenarijih uporabe računalnika in zmogljivosti agentov pa je bila okrepljena.

Posodobitve ekosistema: Claude Code, aplikacije in platforma
Sonnet 4.5 prihaja z veliko posodobitvijo izdelka. Claude Code uvaja kontrolne točke , eno najbolj iskanih funkcij: shranjujejo napredek in uporabnikom omogočajo takojšnjo vrnitev v prejšnja stanja. Za vse, ki razvijajo z dolgimi iteracijami, ta sprememba zmanjšuje trenje in jim daje samozavest pri raziskovanju različnih poti, ne da bi se bali, da bi vse pokvarili.
To je poleg prenovljenega terminalskega vmesnika in izdaje izvorne razširitve za Visual Studio Code , s ciljem neposredne integracije Claudea v integrirano razvojno okolje (IDE), kjer programerji preživljajo svoje dneve. To je pomemben korak naprej, če je cilj, da model prevzame bolj operativno in manj obrobno vlogo.
Na strani API-ja obstajata dve ključni komponenti: urejanje konteksta in novo orodje za shranjevanje in pridobivanje informacij v pomnilniku . Skupaj omogočata agentom daljše delovanje, filtriranje zastarelega konteksta in ohranjanje dostopa do resnično pomembnega – kar je bistveno, ko delovni procesi trajajo več ur in se zahteve nenehno spreminjajo.
V Claudovih aplikacijah je še ena pomembna inovacija možnost izvajanja kode in ustvarjanja datotek (dokumentov, preglednic in predstavitev) znotraj pogovora. To modelu omogoča analizo podatkov, ustvarjanje vsebine in njeno izdelavo v pisarniških formatih, ne da bi zapustil klepet, s čimer se v isti niti združujeta teorija in praksa.
Končno je Claudeova uradna razširitev za Chrome na voljo uporabnikom Maxa, ki so se pridružili čakalnemu seznamu, kar odpira vrata avtomatizaciji opravil brskalnika z manj trenja in večjo zanesljivostjo.
Claude Agent SDK: Gradniki za izdelavo lastnih agentov
Anthropic ne le predstavlja, kaj zmore njegov vodilni izdelek, temveč tudi zagotavlja gradnike, ki jih lahko drugi prilagodijo. Novi komplet za razvoj programske opreme Claude Agent SDK si deli infrastrukturo, ki poganja Claude Code, in je zasnovan za reševanje zahtevnih problemov: upravljanje pomnilnika za dolgotrajne naloge, sistemi dovoljenj, ki uravnotežijo avtonomijo z uporabniškim nadzorom, in koordinacija med podagenti, ki delajo za skupni cilj.
Predlog je, da se ta komplet za razvoj programske opreme (SDK) preoblikuje v ponovno uporabno osnovo, tako da lahko katera koli ekipa zgradi svojega agenta z uporabo orodij, preizkušenih v produkciji . Anthropic vztraja, da čeprav je bil prvotno razvit za aplikacije, ki temeljijo na kodi, kaže prednosti pri širokem naboru nalog.
Predogled raziskave: "Predstavljajte si s Claudom"
Poleg Sonnet 4.5 Anthropic ponuja začasno izkušnjo z imenom »Predstavljajte si s Claudom«. V tem poskusu model ustvarja programsko opremo sproti brez vnaprej določenih funkcionalnosti in se odziva na interakcijo uporabnika v realnem času. V bistvu gre za vpogled v to, kaj je mogoče doseči, ko se zmogljiv model združi s pravo infrastrukturo.
Predogledna različica je na voljo naročnikom Max pet dni in je dostopna na spletni strani claude.ai/imagine. Podjetje jo predstavlja kot igrivo, a hkrati razkrivajočo predstavitev zmogljivosti Sonnet 4.5 v smislu generiranja in prilagajanja.
Varnost, poravnava in raven ASL-3
Uvajanje sistema Sonnet 4.5 podpira varnostna raven ASL-3, ogrodje, ki prilagaja zmogljivosti modela z ustreznimi zaščitnimi ukrepi . Ti ukrepi vključujejo klasifikatorje, zasnovane za odkrivanje potencialno nevarnih vhodnih in izhodnih podatkov, s poudarkom na kemičnih, bioloških, radioloških in jedrskih okoljih (JRKB).
Anthropic priznava, da lahko ti klasifikatorji včasih označijo legitimno vsebino, in da bi se izognili prekinjanju uporabnika, ponuja nadaljevanje pogovora s Sonnet 4, ki predstavlja manjše tveganje za JRKB. Odkar so te filtre prvič opisali, so število lažno pozitivnih rezultatov zmanjšali za faktor deset, od predstavitve Claude Opus 4 maja pa za faktor dva. Obljubljajo, da se bo razločljivost klasifikatorjev še naprej izboljševala.
Uskladitev presega filtre: usposabljanje in varnostne ocene zdaj prvič vključujejo teste, ki jih navdihuje mehanistična interpretabilnost , s ciljem boljšega razumevanja in nadzora notranjega vedenja modela. Poleg tega je bila okrepljena zaščita pred takojšnjim vbrizgavanjem, kar je še posebej pomembno, ko sistem brska, deluje v virtualnih namizjih ali izvaja dejanja.
Razpoložljivost, integracija in cene
Claude Sonnet 4.5 je danes na voljo povsod. Razvijalci ga lahko uporabljajo prek Claude API-ja s klicanjem modela "claude-sonnet-4-5" . Cena ostaja enaka kot pri prejšnji generaciji: 3 $ na milijon vloženih žetonov in 15 $ na milijon izposojenih žetonov.
Anthropic s svojo infrastrukturo ponuja stroškovne prednosti: do 90 % prihranka s hitrim predpomnjenjem in dodatnih 50 % s paketno obdelavo – številke, zasnovane za velike delovne obremenitve. Za končne uporabnike je klepet na voljo s Sonnet 4.5 v Claude.ai (splet, iOS in Android), za podjetja pa je izvorno na voljo na platformi Claude Developer Platform, pa tudi na Amazon Bedrock in Google Cloud Vertex AI.
Na poslovni strani je na voljo brezplačen paket z omejitvijo sej, ki se ponastavi vsakih pet ur , in spremenljivim številom sporočil na zahtevo. Za kompleksne programerske naloge pa Claude Code deluje kot vodilni ponudnik.
Predstavljeni primeri uporabe
Sonnet 4.5 je predstavljen kot idealen model za agente: lahko se odzove skoraj v trenutku ali pa uporabi vidno, postopno razmišljanje, ko naloga to zahteva. Uporabniki API-ja natančno nadzorujejo, kako dolgo model "razmišlja", pri čemer izbirajo med hitrostjo in globino.
Pri razvoju programske opreme zajema celoten življenjski cikel: načrtovanje, generiranje, vzdrževanje, odpravljanje napak in obsežno refaktoriranje . Velik izhodni kontekst (do 64 tisoč žetonov) omogoča izdelavo doslednih, obsežnih načrtov in kode.
Kar zadeva uporabo v brskalnikih in namiznih računalnikih, je vodilni v svoji kategoriji: opravlja dejanske delovne procese, od analize konkurence in nakupa do uvajanja strank na spletu. Namen je, da se bosta natančnost in zanesljivost sčasoma še naprej izboljševali.
Na področju kibernetske varnosti lahko ekipe, ki združujejo Sonnet 4.5 s Claude Code, namestijo agente, ki avtonomno odpravljajo ranljivosti, preden so izkoriščene, s čimer se fokus preusmeri z reaktivnega odkrivanja na proaktivno obrambo.
V financah model obravnava analizo vhodnih podatkov in kompleksne napovedi ; na primer, spremlja globalne regulativne spremembe in proaktivno prilagaja sisteme skladnosti, pri čemer se razvija od ročne priprave revizij do inteligentnega upravljanja tveganj.
Na področju poslovne produktivnosti blesti pri ustvarjanju in urejanju pisarniških datotek (dokumentov, preglednic, predstavitev) . Na področju raziskav pa lahko sledi notranjim in zunanjim virom za sintetiziranje znanja v kompleksnih informacijskih krajinah.
Kar zadeva vsebino, blesti v pisanju z razumevanjem nians in tona, ustvarjanju prepričljivejših besedil in analizi na globlji semantični ravni , kar je dragocena točka za trženje, tehnično dokumentacijo ali korporativno komunikacijo.
Uspešnost in meritve
Podatki, ki jih je predstavil Anthropic, uvrščajo Sonnet 4.5 na 77,2 % v SWE-bench Verified , kar je njegova najboljša uspešnost v programiranju doslej. V OSWorld dosega 61,4 %, s čimer utrjuje svoj položaj najboljšega modela za "uporabo računalnika". Te meritve podpirajo operativni dokazi o nalogah, ki presegajo 30 ur, in izhodna zmogljivost 64 žetonov.
Podjetje navaja, da Sonnet 4.5 opolnomoča agente v zahtevnih sektorjih, kot so finančna analiza, kibernetska varnost in raziskave , saj usklajuje več agentov in obdeluje velike količine podatkov z zanesljivostjo, ki jo ta področja zahtevajo.
Razvoj družine Sonnet in mesto 4.5
Da bi razumeli ta preskok, se moramo ozreti nazaj. Sonnet 3.7 je uvedel hibridni model sklepanja , ki je znatno izboljšal kodiranje, ustvarjanje vsebin in analizo podatkov. Nato je Sonnet 4 ta pristop utrdil s skoraj mejno zmogljivostjo, praktično za uporabniške asistente in naloge z veliko količino.
Sonnet 4.5 gradi na tej poti in jo gre še korak dlje: njegova ambicija je biti najnatančnejša izbira za dolgotrajne naloge, kompleksne agente in uporabo računalnikov , z večjim poznavanjem področij programiranja, financ in kibernetske varnosti.
Kaj pravijo resnični primeri in skupnost
Podjetje Anthropic je poročalo, da so za izdelavo replike Slacka uporabili Sonnet 4.5, ki je deloval 30 ur zapored . Po navedbah podjetja je agent nenadzorovano ustvaril 11.000 vrstic kode in se po zaključku naloge ustavil. Maja je njihov model Opus 4 deloval približno sedem ur, tako da novi rekord daleč presega to mejo.
Zgodba se sliši mogočna, vendar se nianse pojavijo zunaj promocijskega gradiva. Razvijalci, kot je @midudev, pripovedujejo, kako je model v enem samem ukazu preoblikoval celotne projekte – uporabil vzorce, kot je čista arhitektura, in ustvaril stotine ali tisoče vrstic – vendar rezultat pri prevajanju ni deloval. Drugi poročajo o enakem: koda z brezhibno strukturo in profesionalnim videzom, ki pa je med izvajanjem nedelovala.
Poudarjeno je bilo tudi, da Anthropic ni prikazal domnevne aplikacije Slack, ki deluje od začetka do konca, temveč je trdil, da jo je sam zgradil – kar je precejšnja vrzel med komuniciranjem in demonstracijo s preverljivo kodo . Ta vzorec ni edinstven: v celotni industriji se modeli izboljšujejo z ustvarjanjem kode, ki je videti zelo dobro, vendar še vedno pogosto ne uspejo ustvariti funkcionalnih rešitev brez večjega človeškega posredovanja.
Znotraj podjetja so izboljšave presenetile celo njihovo lastno ekipo. Dianne Penn poudarja, da je model trikrat bolj spreten pri uporabi računalnikov kot oktobrska različica in da so zadnji mesec delali s povratnimi informacijami iz GitHuba in Cursorja . Canva kot beta tester pravi, da pomaga pri "kompleksnih, dolgoročnih nalogah". Scott White ga primerja z "ravnjo vodje osebja": usklajevanje urnikov, analiziranje podatkov in pisanje poročil.
Osnovno sporočilo je jasno: tudi z robustnim modelom so za uvedbo zanesljivejših agentov v produkciji še vedno potrebni virtualni stroji, upravljanje pomnilnika in konteksta, podpora za več agentov in sistemi dovoljenj . Prav to vrzel želita zapolniti Agent SDK in nove funkcije platforme.
Konkurenca in tržna pozicija
Izid sistema Sonnet 4.5 velja za del napete konkurence: OpenAI napreduje s svojo naslednjo generacijo, medtem ko Google vztraja pri sistemu Gemini in dela poteze, ki vse silijo, da pospešijo svoja prizadevanja. V tem kontekstu so dolgoročni agenti, neposredna uporaba računalnikov in avtonomno programiranje ključna področja, kjer je na kocki velik del poslovne vrednosti.
Kdorkoli bo prepričal podjetja, da lahko avtomatizirajo delovne procese v resničnem svetu z nadzorom in zanesljivostjo, bo pridobil licence in obsežne uvedbe . Anthropic verjame, da bo kombinacija zmogljivega modela s pravo infrastrukturo – njihovo lastno – premostila vrzel med demonstracijami in trajnostnim delovanjem.
Priporočila za posvojitev in dobre prakse
Če boste resno preizkusili Sonnet 4.5, ne pozabite, da avtonomija ni brez cene. Dejanja, ki jih lahko model izvaja – branje in spreminjanje datotek, premikanje podatkov, izvajanje ukazov in navigacija – zahtevajo jasna pravila in nadzor. Omogočanje sistemov dovoljenj, beleženje dnevnikov nadzora in določanje pragov za človeško posredovanje so ključnega pomena za zmanjševanje tveganj.
V tokovih kode kontrolne točke in pomnilnik API-ja Claude Code pomagajo pri varnem ponavljanju. Kljub temu je priporočljivo avtomatizirati teste in validacijske cevovode ter model uvajati v nadzorovanih fazah (od nalog z majhnim vplivom do kritičnih komponent), preden se delegirajo glavne odgovornosti.
Kje prebrati več in kako začeti
Anthropic priporoča nadgradnjo na Sonnet 4.5 za vse namene: aplikacije, API-je in Claude Code. Nadgradnjo predstavljajo kot neposredno zamenjavo z izboljšano zmogljivostjo po isti ceni . Nove funkcije v Claude Code so na voljo vsem uporabnikom; posodobitve platforme za razvijalce – vključno z Agent SDK – so na voljo celotni skupnosti razvijalcev; izvajanje kode in ustvarjanje datotek v aplikacijah pa sta vključena v vse plačljive pakete.
Za tehnične podrobnosti in rezultate evalvacije se podjetje sklicuje na svojo sistemsko kartico, stran z modelom in dokumentacijo , pa tudi na inženirske publikacije in objavo o raziskavah kibernetske varnosti. Vsakdo, ki želi eksperimentirati z ustvarjanjem programske opreme v realnem času, lahko nekaj dni preizkusi »Imagine with Claude«.
Slika, ki jo prikazujejo te objave, je model, ki dviguje standarde glede uporabe agentov, kode in računalnikov, hkrati pa krepi skalabilnost, varnost in orodja za razvijalce. Še vedno ni jasno, v kolikšni meri se bo praksa ujemala s teorijo, vendar obstajajo konkretni znaki zrelosti in dosleden načrt za premostitev vrzeli med "govoriti dobro" in "delati dobro".