Jam i sigurt që edhe juve ju ka ndodhur: keni një regjistrim të gjatë të një interviste ose të një ore mësimi, dhe ideja e transkriptimit të të gjithës duket si një sipërmarrje e madhe. E vërteta është se transkriptimi i shkrimit me dorë është një barrë e vërtetë dhe një humbje kohe monumentale, veçanërisht kur mjetet e zakonshme falas ngatërrohen me fjalë ose shpikin të dhëna që nuk ekzistojnë.
Këtu hyn në lojë Whisper, një fuqi e inteligjencës artificiale e krijuar nga OpenAI që është këtu për të ndryshuar lojën. Nuk është thjesht një program tjetër, por një model i njohjes automatike të të folurit (ASR) që analizon tingullin me saktësi të mahnitshme, duke na lejuar të marrim tekst të modifikueshëm brenda pak minutash pa asnjë problem.
Çfarë është saktësisht Whisper dhe si funksionon brenda sistemit?
Thënë thjesht, Whisper është një sistem IA i projektuar posaçërisht për të kthyer të folurit në tekst. Ndryshe nga softuerët e tjerë që dështojnë shpesh, ky model analizon modelet audio, kontekstin dhe karakteristikat e folësit për të ofruar një rezultat profesional. Në versionin e tij v3, është trajnuar në mbi një milion orë audio, duke tejkaluar shumë 680.000 orët e versionit të mëparshëm, gjë që ka rezultuar në një reduktim prej 10% deri në 20% të gabimeve.
Një nga gjërat më të mahnitshme është aftësia e tij për të trajtuar spanjishten, ku ka një shkallë gabimi më pak se 5% . Për më tepër, nuk mbetet pas gjuhëve të tjera; mund të transkriptojë më shumë se 100 gjuhë, duke përfshirë katalanishten, baskishten, galicianishten, gjermanishten, arabishten dhe japonishten, dhe madje mund të zbulojë kur folësi ndërron gjuhë në mes të fjalisë.
Karakteristikat teknike dhe shkathtësia
Whisper nuk është një aplikacion i mbyllur, por më tepër një model gjuhe që shërben si bazë për kompanitë e tjera që të krijojnë mjetet e tyre duke përdorur një API. Për t'u përshtatur me çdo harduer, OpenAI e ka publikuar atë në madhësi të ndryshme në varësi të aftësive të makinës . Ekzistojnë versione të lehta që kërkojnë më pak se 1 GB VRAM dhe kanë 39 milion parametra, deri në modele masive me 1.550 miliardë parametra që kërkojnë rreth 10 GB VRAM për të funksionuar me kapacitet të plotë.
Një tjetër avantazh i madh është aftësia e tij për të interpretuar pauzat natyrale në një bisedë. Kjo do të thotë që inteligjenca artificiale di se ku të vendosë një presje ose një pikë bazuar në heshtjen e folësit, duke na kursyer shumë punë redaktimi më vonë. Është ideale për menaxhimin e takimeve, podkasteve ose intervistave me pjesëmarrës të shumtë, pasi identifikon dhe ndan automatikisht folësit.
Si ta vini në punë: nga teknikja tek e thjeshta
Nëse je një ekspert në kompjutera, mund të shkosh direkt në faqen e tyre në GitHub, të shkarkosh kodin me burim të hapur dhe ta ekzekutosh atë lokalisht në kompjuterin tënd duke ndjekur udhëzimet teknike. Kjo është shumë e ngjashme me konfigurimin e një asistenti programimi të inteligjencës artificiale , pasi kërkon njohuri të avancuara dhe nuk është tamam një shëtitje në park për dikë që nuk di të programojë.
Nëse nuk doni t’i ndërlikoni gjërat, ka alternativa shumë më të thjeshta. Për shembull, mund të përdorni platformën Replicate (replicate.com/openai/whisper) , e cila ju lejon të ngarkoni skedarët tuaj dhe të zgjidhni versionin e modelit që dëshironi të përdorni (si p.sh. v3) pa pasur nevojë të instaloni asgjë në kompjuterin tuaj. Në këtë mënyrë, kushdo mund të shfrytëzojë fuqinë e IA-së për të marrë një draft të modifikueshëm në kohë rekord.
Të kesh një mjet të tillë në dorë është një lehtësim, veçanërisht për gazetarët ose studentët që dikur kalonin orë të tëra duke dëgjuar të njëjtin klip audio. Tani, me aftësinë për të përpunuar zërin në kohë reale dhe me saktësi pothuajse kirurgjikale , transkriptimi është shndërruar nga një detyrë e lodhshme në një proces automatik dhe efikas që na lejon të përqendrohemi në atë që është e rëndësishme: analizimin e përmbajtjes.




