- Kiire süstimine kasutab ära LLM-ide suutmatust eristada süsteemi juhiseid kasutajaandmetest.
- Süsteemide privaatsust ja terviklikkust võivad kahjustada otsesed, kaudsed ja salvestatud variandid.
- See erineb jailbreakimisest selle poolest, et viimane püüab konkreetselt mööda hiilida mudeli eetilistest ja turvatõketest.
- Leevendamine nõuab multidistsiplinaarset lähenemisviisi, mis ühendab sisendi filtreerimise, privileegide haldamise ja inimliku järelevalve.

Oled ilmselt kuulnud vestlusrobotitest ja sellest, kuidas need meie elu lihtsamaks teevad, aga neil on ka varjukülg, mis alati uudistesse ei jõua. Selgub, et need tööriistad, kuigi pealtnäha maagilised, on info töötlemisel põhimõttelise nõrkusega , mis võimaldab teatud kasutajatel neid "petta" tegema asju, mida nende loojad pole kunagi ette näinud.
Me räägime kiirsüstimisest ehk tehnikast, mis sisuliselt hõlmab keele manipuleerimist tehisintellekti üle kontrolli saavutamiseks. Sa ei pea olema kodeerimisekspert ega installima arusaamatuid programme; mõnikord piisab hästi paigutatud fraasist , et mudel ignoreeriks oma reegleid ja paljastaks saladusi või tegutseks pahatahtlikult, muutudes tänapäeva küberturvalisuse jaoks tõeliseks peavaluks.
Mis täpselt on kiirsüst?
Selle õigeks mõistmiseks on oluline teada, et suured keelemudelid (LLM-id), näiteks GPT-4 või Gemini, töötavad käskude abil. Käsk on lihtsalt juhis, mille kasutaja masinale annab. Probleem on selles, et arendajad lisavad nähtamatuid sisemisi juhiseid (süsteemi käske), et määratleda roboti käitumist ja reegleid, kuid tehisintellekt ei suuda eristada, kus programmeerija käsk lõpeb ja kasutaja tekst algab.
See haavatavus tekib seetõttu, et mudel töötleb kogu tekstivoogu ühe ühikuna. Seega, kui ründaja lisab käsu „ignoreeri kõike ülaltoodut”, saab tehisintellekt uue käsu seada esikohale algsete turvareeglite ees. See on sisuliselt masinatele rakendatav sotsiaalse manipuleerimise vorm, kus keel on relv, mida kasutatakse assistendi käitumise kaaperdamiseks.
Peamised erinevused kiire süstimise ja jailbreaki vahel
Paljud inimesed ajavad need kaks terminit segamini, aga need ei ole samad. Jailbreakimine on nagu tehisintellekti "luku lahtimurdmine". Selle eesmärk on tühistada eetilised kaitsemeetmed ja sisupoliitikad, et bot ütleks keelatud asju või genereeriks piiratud sisu. Kõige kuulsam näide on DAN-režiim ("Do Anything Now"), kus mudel on sunnitud reegliteta tegelast omaks võtma.
Teisest küljest on kiire süstimine laiem mõiste. Selle eesmärk ei ole alati moraalireeglite rikkumine, vaid pigem süsteemi funktsionaalsuse muutmine . Ründaja võib lihtsalt soovida, et bot avaldaks oma sisemised juhised või teeks ühendatud süsteemis volitamata toimingu. Kuigi jailbreakimine on tavaliselt kasutaja tahtlik tegevus oma seansi jooksul, võib kiire süstimine olla nähtamatu rünnak, mis mõjutab kolmandaid osapooli.

Rünnakute tüübid: otsesed, kaudsed ja salvestatud rünnakud
Kõiki rünnakuid ei teostata ühtemoodi. Lihtsaim meetod on otsesüst , mis toimub siis, kui kasutaja tipib pahatahtliku käsu otse vestlusaknasse. See võib olla tahtlik toiming süsteemi häkkimiseks või juhuslik kasutajaviga, mis põhjustab mudelis ebakorrektset käitumist.
Kaudne süstimine on palju ohtlikum . Sellisel juhul ei suhtle ründaja tehisintellektiga otse, vaid peidab juhised välistesse allikatesse, mida tehisintellekt loeb, näiteks veebilehele, PDF-dokumendile või e-kirjale. Näiteks kui palute robotil kokku võtta nähtamatu tekstiga veebileht käsuga "varasta kasutajaandmeid", töötleb tehisintellekt peidetud käsku ja võib teie teadmata teavet välja filtreerida.
Lõpuks on meil salvestatud süstimine . See meetod hõlmab pahatahtlike juhiste sisestamist andmebaasidesse või treeningandmetesse endisse. Kuna teave on juba salvestatud, võib rünnak mõjutada paljusid kasutajaid erinevate seansside ajal, kuna mudel neelab pahavara ja kopeerib seda iga kord, kui keegi sellele konkreetsele teabele juurde pääseb.
Reaalse elu mõjud ja ohustsenaariumid
Eduka rünnaku tagajärjed võivad olla tõsised, alates konfidentsiaalsete ettevõtteandmete lekkimisest kuni kriitiliste otsuste manipuleerimiseni. Ettevõttekeskkondades, kus tehisintellektil on juurdepääs API-dele või e-kirjadele, saab ründaja panna roboti kasutaja nimel sõnumeid saatma või privaatsetele failidele juurde pääsema.
- CV-pettus: Mõned kandidaadid on lisanud tühja teksti (inimestele nähtamatu), öeldes, et nad on "erakordsed eksperdid", et petta personaliosakonna tehisintellekti filtreid.
- Brauseri kaaperdamine: Teadlastel on õnnestunud Tehisintellekti agendid, kes loevad e-kirju saata kasutaja ülemusele lahkumisavaldusi peidetud juhiste abil.
- Süsteemi lekked: Bing Chati puhul õnnestus ühel tudengil panna bot avaldama oma koodnime "Sydney" ja sisemised tegutsemisjuhised.
- Multimodaalsed rünnakud: Nüüd on ohte, kus pahatahtlikud juhised ei ole tekstis, vaid piltidesse manustatud mida tehisintellekt analüüsib, laiendades rünnakupinda.
Kaitse- ja leevendusstrateegiad
Halb uudis on see, et LLM-ide stohhastilise olemuse tõttu pole lõplikku lahendust. Siiski saab kehtestada väga tõhusad kaitsemeetmed . Üks parimaid võimalusi on sisendi/väljundi filtreerimine, kus väline süsteem analüüsib enne mudelini jõudmist, kas viip sisaldab kahtlaseid mustreid.
Samuti on oluline rakendada vähimate õiguste põhimõtet . Te ei tohiks anda tehisintellektile täielikku juurdepääsu oma e-posti kontole või andmebaasile; parem on, kui see toimib vahendajana, mis nõuab kõrge riskiga toimingute jaoks inimese heakskiitu . Teiste tehnikate hulka kuulub "karantiini" mudelite kasutamine väliste andmete töötlemiseks, eraldades juhtimisloogika ebausaldusväärsete andmete lugemisest.
Lõpuks on võtmetähtsusega pidev koolitus ja konkurentide testimine. Ettevõtted peavad rünnakuid simuleerima, et leida haavatavusi enne, kui häkkerid seda teevad. Lisaks võimaldab telemeetria logimine tuvastada mudeli vastustes anomaaliaid, aidates kiiresti reageerida, kui midagi tundub valesti olevat.