Сигуран сам да вам се то десило: имате дугачак снимак интервјуа или часа, и сама помисао на транскрипцију свега делује као огроман подухват. Истина је да је транскрипција рукописа права мука и огромно губљење времена, посебно када се уобичајени бесплатни алати помешају са речима или измишљају податке који не постоје.
Ту на сцену ступа Whisper, AI сила коју је креирао OpenAI и која је ту да промени правила игре. То није само још један програм, већ модел аутоматског препознавања говора (ASR) који анализира звук са запањујућом тачношћу, омогућавајући нам да добијемо текст који се може уређивати за неколико минута без икаквих проблема.
Шта је тачно Whisper и како функционише интерно?
Једноставно речено, Whisper је систем вештачке интелигенције посебно дизајниран за претварање говора у текст. За разлику од других софтвера који често не успевају, овај модел анализира аудио обрасце, контекст и карактеристике говорника како би пружио професионални резултат. У својој v3 верзији, обучен је на преко милион сати звука, што далеко премашује 680.000 сати претходне верзије, што је резултирало смањењем грешака за 10% до 20%.
Једна од најневероватнијих ствари је његова способност да обрађује шпански, где има стопу грешака мању од 5% . Штавише, не заостаје ни са другим језицима; може да транскрибује више од 100 језика, укључујући каталонски, баскијски, галицијски, немачки, арапски и јапански, па чак може и да детектује када говорник промени језик усред реченице.
Техничке карактеристике и свестраност
Whisper није затворена апликација, већ језички модел који служи као основа другим компанијама за креирање сопствених алата користећи API. Да би се прилагодио било ком хардверу, OpenAI га је објавио у различитим величинама у зависности од могућности машине . Постоје лагане верзије које захтевају мање од 1 GB VRAM-а и имају 39 милиона параметара, па све до масивних модела са 1.550 милијарди параметара којима је потребно око 10 GB VRAM-а да би радили пуним капацитетом.
Још једна огромна предност је његова способност да тумачи природне паузе у разговору. То значи да вештачка интелигенција зна где да постави зарез или тачку на основу тишине говорника, што нам касније штеди много посла око уређивања. Идеалан је за управљање састанцима, подкастима или интервјуима са више учесника, јер аутоматски идентификује и одваја говорнике.
Како га покренути и покренути: од техничког до једноставног
Ако сте компјутерски геније, можете директно да одете на њихову GitHub страницу, преузмете отворени код и покренете га локално на свом рачунару пратећи техничка упутства. Ово је веома слично подешавању вештачке интелигенције , јер захтева напредно знање и није баш лак задатак за некога ко не зна да програмира.
Ако не желите да компликујете ствари, постоје много једноставније алтернативе. На пример, можете користити платформу Replicate (replicate.com/openai/whisper) , која вам омогућава да отпремите своје датотеке и изаберете коју верзију модела желите да користите (као што је v3) без потребе да инсталирате било шта на рачунар. На овај начин, свако може искористити моћ вештачке интелигенције да добије нацрт који се може уређивати у рекордном року.
Имати овакав алат при руци је олакшање, посебно за новинаре или студенте који су раније проводили сате слушајући исти аудио снимак. Сада, уз могућност обраде гласа у реалном времену и са готово хируршком прецизношћу , транскрипција је од заморног задатка прешла у аутоматски и ефикасан процес који нам омогућава да се фокусирамо на оно што је важно: анализу садржаја.




