Prepričan sem, da se vam je to že zgodilo: imate dolg posnetek intervjuja ali predavanja in misel na prepisovanje vsega se vam zdi ogromen podvig. Resnica je, da je prepisovanje rokopisa prava muka in ogromna izguba časa, še posebej, če običajna brezplačna orodja zamenjate z besedami ali si izmislite podatke, ki ne obstajajo.
Tukaj nastopi Whisper, zmogljiva umetna inteligenca, ki jo je ustvaril OpenAI in je tu, da spremeni pravila igre. Ni le še en program, temveč model samodejnega prepoznavanja govora (ASR) , ki analizira zvok z osupljivo natančnostjo in nam omogoča, da v nekaj minutah brez težav dobimo besedilo, ki ga je mogoče urejati.
Kaj točno je Whisper in kako deluje interno?
Preprosto povedano, Whisper je sistem umetne inteligence, posebej zasnovan za pretvorbo govora v besedilo. Za razliko od druge programske opreme, ki pogosto odpove, ta model analizira zvočne vzorce, kontekst in značilnosti govorca, da bi zagotovil profesionalen rezultat. V različici v3 je bil usposobljen na več kot milijonu ur zvoka, kar daleč presega 680.000 ur prejšnje različice, kar je zmanjšalo število napak za 10 % do 20 %.
Ena najbolj neverjetnih stvari je njegova sposobnost obvladovanja španščine, kjer ima stopnjo napak manjšo od 5 % . Poleg tega ne zaostaja niti pri drugih jezikih; lahko prepiše več kot 100 jezikov, vključno s katalonščino, baskovščino, galicijščino, nemščino, arabščino in japonščino, in celo zazna, kdaj govorec sredi stavka zamenja jezik.
Tehnične lastnosti in vsestranskost
Whisper ni zaprta aplikacija, temveč jezikovni model, ki služi kot osnova za druga podjetja pri ustvarjanju lastnih orodij z uporabo API-ja. Za prilagoditev kateri koli strojni opremi ga je OpenAI izdal v različnih velikostih, odvisno od zmogljivosti naprave . Obstajajo lahke različice, ki zahtevajo manj kot 1 GB VRAM-a in imajo 39 milijonov parametrov, do ogromnih modelov z 1.550 milijarde parametrov, ki za delovanje s polno zmogljivostjo potrebujejo približno 10 GB VRAM-a.
Druga velika prednost je njegova sposobnost interpretiranja naravnih premorov v pogovoru. To pomeni, da umetna inteligenca ve, kam postaviti vejico ali piko glede na molk govorca, kar nam kasneje prihrani veliko urejanja. Idealen je za upravljanje sestankov, podkastov ali intervjujev z več udeleženci, saj samodejno prepozna in loči govorce.
Kako ga zagnati in zagnati: od tehničnega do preprostega
Če ste računalniški genij, lahko obiščete njihovo stran GitHub, prenesete odprtokodno kodo in jo zaženete lokalno na svojem računalniku po tehničnih navodilih. To je zelo podobno nastavitvi programskega asistenta z umetno inteligenco , saj zahteva napredno znanje in ni ravno mačji kašelj za nekoga, ki ne zna programirati.
Če ne želite zapletati stvari, obstajajo veliko preprostejše alternative. Na primer, lahko uporabite platformo Replicate (replicate.com/openai/whisper) , ki vam omogoča nalaganje datotek in izbiro različice modela, ki jo želite uporabiti (kot je v3), ne da bi morali karkoli namestiti v računalnik. Na ta način lahko kdorkoli izkoristi moč umetne inteligence in v rekordnem času pridobi osnutek, ki ga je mogoče urejati.
Imeti takšno orodje pri roki je olajšanje, še posebej za novinarje ali študente, ki so prej ure in ure poslušali isti zvočni posnetek. Zdaj, ko lahko glas obdelujemo v realnem času in s skoraj kirurško natančnostjo , se je prepisovanje iz dolgočasne naloge spremenilo v samodejen in učinkovit postopek, ki nam omogoča, da se osredotočimo na tisto, kar je pomembno: analizo vsebine.




