Olen kindel, et see on sinuga juhtunud: sul on pikk intervjuu või tunni salvestis ja mõte selle kõige ümberkirjutamisest tundub tohutu ettevõtmisena. Tõde on see, et käsitsi kirjutatud transkriptsioon on tõeline tüütus ja tohutu ajaraiskamine, eriti kui tavalised tasuta tööriistad lähevad sõnadega segi või mõtlevad välja andmeid, mida pole olemas.
Siin tulebki mängu Whisper, OpenAI loodud tehisintellekti jõujaam, mis on tulnud mängu muutma. See pole lihtsalt järjekordne programm, vaid automaatne kõnetuvastusmudel (ASR) , mis analüüsib heli hämmastava täpsusega, võimaldades meil minutitega ja vaevata hankida redigeeritavat teksti.
Mis täpselt on Whisper ja kuidas see sisemiselt töötab?
Lihtsamalt öeldes on Whisper tehisintellekti süsteem, mis on spetsiaalselt loodud kõne tekstiks teisendamiseks. Erinevalt teistest tarkvaradest, mis sageli ebaõnnestuvad, analüüsib see mudel professionaalse tulemuse saavutamiseks helimustreid, konteksti ja kõneleja omadusi . Oma v3 versioonis on seda treenitud enam kui miljoni tunni heli peal, mis ületab kaugelt eelmise versiooni 680 000 tundi, mille tulemuseks on vigade vähenemine 10–20%.
Üks hämmastavamaid asju on selle võime hakkama saada hispaania keelega, kus veamäär on alla 5% . Lisaks ei jää see teistele keeltele alla; see suudab transkribeerida enam kui 100 keelt, sealhulgas katalaani, baski, galeegi, saksa, araabia ja jaapani keelt, ning suudab isegi tuvastada, millal kõneleja lause keskel keelt vahetab.
Tehnilised omadused ja mitmekülgsus
Whisper ei ole suletud rakendus, vaid pigem keelemudel, mis on aluseks teistele ettevõtetele oma tööriistade loomiseks API abil. Et kohaneda mis tahes riistvaraga, on OpenAI selle välja andnud erinevates suurustes, olenevalt masina võimalustest . Saadaval on kerged versioonid, mis vajavad vähem kui 1 GB videomälu ja millel on 39 miljonit parameetrit, kuni massiivsete mudeliteni, millel on 1.550 miljardit parameetrit ja mis vajavad täisvõimsusel töötamiseks umbes 10 GB videomälu.
Teine tohutu eelis on selle võime tõlgendada vestluses esinevaid loomulikke pause . See tähendab, et tehisintellekt teab kõneleja vaikimise põhjal, kuhu koma või punkt panna, säästes meile hiljem hulgaliselt toimetamistööd. See on ideaalne koosolekute, taskuhäälingusaadete või mitme osalejaga intervjuude haldamiseks, kuna see tuvastab ja eraldab kõnelejad automaatselt.
Kuidas see tööle panna: tehnilisest lihtsani
Kui oled arvutigeenius, võid minna otse nende GitHubi lehele, alla laadida avatud lähtekoodiga koodi ja käivitada selle oma arvutis kohapeal, järgides tehnilisi juhiseid. See on väga sarnane tehisintellekti programmeerimisassistendi seadistamisega , kuna see nõuab edasijõudnutele teadmisi ja pole just kerge ülesanne kellelegi, kes programmeerida ei oska.
Kui te ei soovi asju keeruliseks ajada, on palju lihtsamaid alternatiive. Näiteks võite kasutada Replicate platvormi (replicate.com/openai/whisper) , mis võimaldab teil oma faile üles laadida ja valida, millist mudeli versiooni soovite kasutada (näiteks v3), ilma et peaksite oma arvutisse midagi installima. Nii saab igaüks tehisintellekti jõudu rakendada, et saada rekordajaga muudetav mustand.
Sellise tööriista omamine on kergendus, eriti ajakirjanikele või tudengitele, kes varem veetsid tunde sama heliklippi kuulates. Nüüd, kus häält saab reaalajas ja peaaegu kirurgilise täpsusega töödelda , on transkriptsioon muutunud tüütust ülesandest automaatseks ja tõhusaks protsessiks, mis võimaldab meil keskenduda olulisele: sisu analüüsimisele.




