Esmu pārliecināts, ka arī jums tas ir gadījies: jums ir garš intervijas vai nodarbības ieraksts, un doma par tā visa pārrakstīšanu šķiet milzīgs uzdevums. Patiesība ir tāda, ka rokraksta transkripcija ir īsts apgrūtinājums un milzīgs laika izšķiešana, it īpaši, ja parastie bezmaksas rīki sajaucas ar vārdiem vai izdomā datus, kas neeksistē.
Šeit noder Whisper — OpenAI radīta mākslīgā intelekta dzinējspēks, kas ir ieradies, lai mainītu spēles noteikumus. Tā nav tikai vēl viena programma, bet gan automātiskas runas atpazīšanas (ASR) modelis , kas analizē skaņu ar pārsteidzošu precizitāti, ļaujot mums dažu minūšu laikā bez jebkādām problēmām iegūt rediģējamu tekstu.
Kas īsti ir Whisper un kā tas darbojas iekšēji?
Vienkārši sakot, Whisper ir mākslīgā intelekta sistēma, kas īpaši izstrādāta runas pārveidošanai tekstā. Atšķirībā no citām programmatūrām, kas bieži neizdodas, šis modelis analizē audio modeļus, kontekstu un runātāja raksturlielumus, lai nodrošinātu profesionālu rezultātu. Savā 3. versijā tas ir apmācīts ar vairāk nekā miljonu audio stundu, kas ievērojami pārsniedz iepriekšējās versijas 680 000 stundas, kā rezultātā kļūdu skaits ir samazinājies par 10–20 %.
Viena no apbrīnojamākajām lietām ir tās spēja apstrādāt spāņu valodu, kur kļūdu līmenis ir mazāks par 5% . Turklāt tai netrūkst citu valodu transkribēšanas; tā var transkribēt vairāk nekā 100 valodas, tostarp katalāņu, basku, galisiešu, vācu, arābu un japāņu valodu, un pat var noteikt, kad runātājs teikuma vidū maina valodu.
Tehniskās īpašības un daudzpusība
Whisper nav slēgta lietojumprogramma, bet gan valodas modelis, kas kalpo par pamatu citiem uzņēmumiem, lai izveidotu savus rīkus, izmantojot API. Lai pielāgotos jebkurai aparatūrai, OpenAI to ir izlaidis dažādos izmēros atkarībā no ierīces iespējām . Ir pieejamas vieglas versijas, kurām nepieciešams mazāk nekā 1 GB VRAM un kurām ir 39 miljoni parametru, kā arī masīvi modeļi ar 1.550 miljardiem parametru, kuriem pilnai darbībai nepieciešami aptuveni 10 GB VRAM.
Vēl viena milzīga priekšrocība ir spēja interpretēt dabiskās pauzes sarunā. Tas nozīmē, ka mākslīgais intelekts zina, kur ievietot komatu vai punktu, pamatojoties uz runātāja klusēšanu, tādējādi ietaupot mums daudz rediģēšanas darba vēlāk. Tas ir ideāli piemērots sanāksmju, podkāstu vai interviju ar vairākiem dalībniekiem pārvaldībai, jo tas automātiski identificē un atdala runātājus.
Kā to sākt lietot: no tehniskā līdz vienkāršajam
Ja esat datorspeciālists, varat doties tieši uz viņu GitHub lapu, lejupielādēt atvērtā pirmkoda kodu un palaist to lokāli savā datorā, ievērojot tehniskos norādījumus. Tas ir ļoti līdzīgi mākslīgā intelekta programmēšanas asistenta iestatīšanai , jo tas prasa padziļinātas zināšanas un nav gluži pastaiga parkā kādam, kurš neprot programmēt.
Ja nevēlaties sarežģīt lietas, ir daudz vienkāršākas alternatīvas. Piemēram, varat izmantot Replicate platformu (replicate.com/openai/whisper) , kas ļauj augšupielādēt failus un izvēlēties, kuru modeļa versiju vēlaties izmantot (piemēram, v3), neinstalējot neko datorā. Tādā veidā ikviens var izmantot mākslīgā intelekta jaudu, lai rekordīsā laikā iegūtu rediģējamu melnrakstu.
Šāda rīka esamība pa rokai ir atvieglojums, īpaši žurnālistiem vai studentiem, kuri agrāk stundām ilgi klausījās vienu un to pašu audioklipu. Tagad, pateicoties iespējai apstrādāt balsi reāllaikā un ar gandrīz ķirurģisku precizitāti , transkripcija ir kļuvusi no nogurdinoša uzdevuma par automātisku un efektīvu procesu, kas ļauj mums koncentrēties uz svarīgāko: satura analīzi.




