Esu tikras, kad jums taip yra nutikę: turite ilgą interviu ar paskaitos įrašą ir mintis jį perrašyti atrodo kaip milžiniškas darbas. Tiesa ta, kad ranka rašytas tekstas yra tikras vargas ir laiko švaistymas, ypač kai įprastos nemokamos priemonės susipainioja su žodžiais arba išgalvoja duomenis, kurių nėra.
Čia ir praverčia „Whisper“ – „OpenAI“ sukurtas dirbtinio intelekto galingasis įrenginys, skirtas pakeisti žaidimo taisykles. Tai ne šiaip programa, o automatinio kalbos atpažinimo (ASR) modelis , kuris stebinančiu tikslumu analizuoja garsą ir leidžia mums per kelias minutes be jokio vargo gauti redaguojamą tekstą.
Kas tiksliai yra „Whisper“ ir kaip jis veikia viduje?
Paprastai tariant, „Whisper“ yra dirbtinio intelekto sistema, specialiai sukurta kalbai konvertuoti į tekstą. Skirtingai nuo kitos programinės įrangos, kuri dažnai neveikia, šis modelis analizuoja garso modelius, kontekstą ir kalbėtojo charakteristikas, kad pateiktų profesionalų rezultatą. Trečioji versija buvo apmokyta su daugiau nei milijonu valandų garso įrašų, gerokai viršijant ankstesnės versijos 3 680.000 valandų, todėl klaidų skaičius sumažėjo 10–20 %.
Vienas nuostabiausių dalykų yra jo gebėjimas susitvarkyti su ispanų kalba, kur klaidų lygis yra mažesnis nei 5% . Be to, jis nenusileidžia kitoms kalboms; gali transkribuoti daugiau nei 100 kalbų, įskaitant katalonų, baskų, galisų, vokiečių, arabų ir japonų kalbas, ir netgi gali aptikti, kada kalbėtojas pakeičia kalbą sakinio viduryje.
Techninės savybės ir universalumas
„Whisper“ nėra uždara programa, o kalbos modelis, kuris naudojamas kaip pagrindas kitoms įmonėms kurti savo įrankius naudojant API. Kad galėtų prisitaikyti prie bet kokios aparatinės įrangos, „OpenAI“ išleido ją įvairių dydžių, priklausomai nuo kompiuterio galimybių . Yra lengvų versijų, kurioms reikia mažiau nei 1 GB vaizdo atminties ir kurios turi 39 milijonus parametrų, arba didžiulių modelių su 1.550 milijardo parametrų, kuriems reikia apie 10 GB vaizdo atminties, kad veiktų visu pajėgumu.
Dar vienas didžiulis privalumas yra gebėjimas interpretuoti natūralias pauzes pokalbyje. Tai reiškia, kad dirbtinis intelektas žino, kur dėti kablelį ar tašką, remdamasis kalbėtojo tyla, todėl vėliau sutaupo daug redagavimo darbo. Tai idealiai tinka valdyti susitikimus, tinklalaides ar interviu su keliais dalyviais, nes automatiškai atpažįsta ir atskiria kalbėtojus.
Kaip jį paleisti: nuo techninių iki paprastų
Jei esate kompiuterių genijus, galite apsilankyti tiesiai jų „GitHub“ puslapyje, atsisiųsti atvirojo kodo kodą ir paleisti jį lokaliai savo kompiuteryje, vadovaudamiesi techninėmis instrukcijomis. Tai labai panašu į dirbtinio intelekto programavimo asistento nustatymą , nes tam reikia pažangių žinių ir tai nėra lengva užduotis tiems, kurie nemoka programuoti.
Jei nenorite visko komplikuoti, yra daug paprastesnių alternatyvų. Pavyzdžiui, galite naudoti „Replicate“ platformą (replicate.com/openai/whisper) , kuri leidžia įkelti failus ir pasirinkti, kurią modelio versiją norite naudoti (pvz., v3), nereikia nieko įdiegti kompiuteryje. Tokiu būdu kiekvienas gali pasinaudoti dirbtinio intelekto galia ir gauti redaguojamą juodraštį per rekordiškai trumpą laiką.
Turėti tokį įrankį po ranka yra didelis palengvėjimas, ypač žurnalistams ar studentams, kurie anksčiau valandų valandas klausydavosi to paties garso įrašo. Dabar, kai balsą galima apdoroti realiuoju laiku ir beveik chirurginiu tikslumu , transkripcija iš varginančios užduoties tapo automatiniu ir efektyviu procesu, leidžiančiu mums sutelkti dėmesį į tai, kas svarbu: turinio analizę.




