Siguran sam da vam se to već dogodilo: imate dugu snimku intervjua ili predavanja i sama pomisao na transkripciju čini se kao ogroman pothvat. Istina je da je transkripcija rukom prava muka i ogromno gubljenje vremena, posebno kada se uobičajeni besplatni alati pomiješaju s riječima ili izmisle podatke koji ne postoje.
Tu nastupa Whisper, AI snaga koju je stvorio OpenAI i koja je tu da promijeni pravila igre. To nije samo još jedan program, već model automatskog prepoznavanja govora (ASR) koji analizira zvuk s nevjerojatnom točnošću, omogućujući nam da dobijemo tekst koji se može uređivati u nekoliko minuta bez ikakvih problema.
Što je točno Whisper i kako interno funkcionira?
Jednostavno rečeno, Whisper je AI sustav posebno dizajniran za pretvaranje govora u tekst. Za razliku od drugih softvera koji često ne uspijevaju, ovaj model analizira audio obrasce, kontekst i karakteristike govornika kako bi pružio profesionalni rezultat. U svojoj v3 verziji, obučen je na više od milijun sati zvuka, što daleko nadmašuje 680 000 sati prethodne verzije, što je rezultiralo smanjenjem pogrešaka za 10% do 20%.
Jedna od najnevjerojatnijih stvari je njegova sposobnost rukovanja španjolskim, gdje ima stopu pogrešaka manju od 5% . Nadalje, ne zaostaje ni s drugim jezicima; može transkribirati više od 100 jezika, uključujući katalonski, baskijski, galicijski, njemački, arapski i japanski, pa čak može prepoznati kada govornik promijeni jezik usred rečenice.
Tehničke značajke i svestranost
Whisper nije zatvorena aplikacija, već jezični model koji služi kao temelj drugim tvrtkama za izradu vlastitih alata pomoću API-ja. Kako bi se prilagodio bilo kojem hardveru, OpenAI ga je izdao u različitim veličinama ovisno o mogućnostima stroja . Postoje lagane verzije koje zahtijevaju manje od 1 GB VRAM-a i imaju 39 milijuna parametara, do masivnih modela s 1.550 milijardi parametara kojima je potrebno oko 10 GB VRAM-a za rad punim kapacitetom.
Još jedna ogromna prednost je njegova sposobnost tumačenja prirodnih pauza u razgovoru. To znači da umjetna inteligencija zna gdje staviti zarez ili točku na temelju tišine govornika, što nam kasnije štedi mnogo posla uređivanja. Idealan je za upravljanje sastancima, podcastima ili intervjuima s više sudionika jer automatski identificira i odvaja govornike.
Kako ga pokrenuti: od tehničkog do jednostavnog
Ako ste računalni genijalac, možete otići izravno na njihovu GitHub stranicu, preuzeti otvoreni kod i pokrenuti ga lokalno na svom računalu slijedeći tehničke upute. Ovo je vrlo slično postavljanju AI programskog asistenta , jer zahtijeva napredno znanje i nije baš lagan zadatak za nekoga tko ne zna programirati.
Ako ne želite komplicirati stvari, postoje puno jednostavnije alternative. Na primjer, možete koristiti platformu Replicate (replicate.com/openai/whisper) koja vam omogućuje prijenos datoteka i odabir verzije modela koju želite koristiti (poput v3) bez potrebe za instaliranjem ičega na računalo. Na taj način svatko može iskoristiti snagu umjetne inteligencije kako bi u rekordnom roku dobio nacrt koji se može uređivati.
Imati ovakav alat pri ruci pravo je olakšanje, posebno za novinare ili studente koji su prije satima slušali isti audio isječak. Sada, s mogućnošću obrade glasa u stvarnom vremenu i s gotovo kirurškom preciznošću , transkripcija je od zamornog zadatka postala automatski i učinkovit proces koji nam omogućuje da se usredotočimo na ono što je važno: analizu sadržaja.




