- Struktura themelore e rrjeteve nervore bazuar në shtresat hyrëse, të fshehura dhe dalëse që përpunojnë të dhënat përmes funksioneve të aktivizimit.
- Mekanizmat e të mësuarit të mbikëqyrur të përqendruar në përhapjen përpara dhe optimizimin e gabimeve përmes përhapjes prapa dhe zbritjes së gradientit.
- Shfaqja e arkitekturave efikase, siç janë rrjetet e lehta dhe modelet pa peshë, të cilat eliminojnë shumëzimet e kushtueshme për të zvogëluar konsumin e energjisë.
Nëse ndonjëherë keni menduar se çfarë fshihet pas magjisë së inteligjencës artificiale, përgjigjja e shkurtër është se ne po përpiqemi të imitojmë funksionimin e trurit të njeriut . Imagjinoni një rrjet shumë kompleks qelizash të quajtura neurone që dërgojnë impulse elektrike tek njëra-tjetra në mënyrë që të mund ta kuptojmë botën; epo, shkencëtarët e kompjuterave kanë krijuar një version softueri, me nyje dhe algoritme, për të zgjidhur probleme matematikore që do të na duheshin orë të tëra.
Në botën e inteligjencës artificiale, jo gjithçka është njësoj. Ne kemi kaluar nga modele të thjeshta në rrjete të thella nervore që menaxhojnë miliona lidhje, dhe tani po shohim drejt arkitekturave që synojnë të jenë shumë më të qëndrueshme dhe më të shpejta, duke u shkëputur nga paradigmat që kemi përdorur për dekada të tëra. Le t'i analizojmë të gjitha këto në mënyrë që të mos keni dyshime.
Struktura bazë e një rrjeti nervor

Që një rrjet të funksionojë, ai zakonisht organizohet në tre lloje shtresash. Së pari, është shtresa hyrëse , ku hyjnë të dhënat nga jashtë; këtu, nyjet analizojnë dhe klasifikojnë informacionin përpara se ta dërgojnë në nivelin tjetër. Pastaj vijnë shtresat e fshehura , të cilat mund të jenë një shtresë e vetme ose mijëra në rastin e të mësuarit të thellë. Këto shtresa bëjnë punën e rëndë, duke përpunuar rezultatin e shtresës së mëparshme për të nxjerrë modele.
Së fundmi, arrijmë në shtresën e daljes , e cila na jep rezultatin përfundimtar. Në varësi të asaj që kërkojmë, mund të ketë një nyje të vetme (si në një pyetje po/jo) ose disa nëse kemi të bëjmë me një problem klasifikimi shumëklasësh . Në rrjetet e thella, çelësi qëndron te peshat , numra që tregojnë nëse një neuron stimulon apo pengon një tjetër, duke përcaktuar kështu ndikimin e secilës lidhje në rezultatin përfundimtar.
Procesi i të mësuarit: Nga teoria në praktikë

Mësimi është thjesht rregullimi i këtyre peshave për të shmangur gabimet. Hapi i parë është përhapja përpara , që në thelb është udhëtimi i të dhënave nga ana e majtë në të djathtë të rrjetit. Neuronet kryejnë një shumë të ponderuar të të dhënave hyrëse , shtojnë një parametër të quajtur paragjykim (për të siguruar më shumë fleksibilitet algjebrik) dhe e kalojnë rezultatin përmes një funksioni aktivizimi.
Le të flasim për këto funksione, sepse janë ato që e pengojnë rrjetin të jetë një regresion linear i thjeshtë. Më të zakonshmet janë funksioni Sigmoid , i cili kthen vlera midis 0 dhe 1 (ideale për probabilitetet), dhe funksioni ReLu , i cili është mbretëresha e të mësuarit të thellë sepse është shumë i thjeshtë dhe parandalon zhdukjen e gradientit gjatë trajnimit.
Magjia e përhapjes prapa dhe zbritjes gradient
Kur rrjeti dështon, hyn në lojë përhapja prapa . Këtu, procesi është i kundërt: ne punojmë nga dalja në hyrje për të llogaritur gabimin. Ne përdorim funksione si Gabimi Mesatar në Katror (MSE) për të përcaktuar se sa kemi devijuar nga realiteti. Prej andej, ne aplikojmë zbritjen gradient , e cila na tregon se në cilin drejtim duhet të rregullojmë peshat për të minimizuar atë gabim.
Një pikë kritike këtu është shkalla e të mësuarit . Nëse është shumë e lartë, rrjeti mëson shpejt, por mund ta tejkalojë pikën optimale dhe të bëhet i pasaktë; nëse është shumë e ulët, procesi është i pafund dhe mund të mos e përfundojë kurrë të mësuarit. Është një ekuilibër delikat që përcakton cilësinë e trajnimit.
Evolucioni drejt inteligjencës artificiale të qëndrueshme: Rrjete të lehta dhe modele pa peshë
Problemi me të mësuarit e thellë aktual është se ai konsumon një sasi të madhe energjie për shkak të miliarda shumëzimeve që kryen. Kjo është arsyeja pse kanë dalë rrjete nervore të lehta , duke përdorur teknika si shkurtimi për të eliminuar lidhjet e panevojshme dhe për të zvogëluar gjurmën e tyre të energjisë pa sakrifikuar shumë fuqi përpunimi.
Por kërcimi i vërtetë revolucionar vjen me rrjetet nervore pa peshë , të hulumtuara nga ekspertë si Lizy K. John. Në vend që të shumëzojnë të dhënat hyrëse me pesha, ato përdorin tabela kërkimi të ndërlidhura me të dhëna binare. Ky është një ndryshim i plotë paradigme: ne kalojmë nga kryerja e llogaritjeve të kushtueshme aritmetike në kryerjen e pyetjeve të shpejta, duke lejuar që rrjeti të jetë deri në 1.000 herë më i vogël dhe më efikas.
Aplikimet në botën reale dhe e ardhmja e Edge Computing

Këto arkitektura ultra-efikase janë flori i pastër për informatikën në skaje , ku përpunimi ndodh direkt në pajisje, jo në cloud. Imagjinoni sensorë mjekësorë që monitorojnë EKG-në ose presionin e gjakut në kohë reale pa e shkarkuar baterinë brenda disa minutash, ose sisteme zbulimi fjalësh kyçe (si ato të Alexa-s) që konsumojnë një pjesë të vogël të nanojoulit të sotëm.
Për më tepër, në sektorin industrial, optimizimi i ftohjes në qendrat e të dhënave duke përdorur modele të lehta ka ulur konsumin e energjisë deri në 30%. Trendi është i qartë: ne nuk po kërkojmë më vetëm modele më të mëdha, por një inteligjencë artificiale më të përgjegjshme që mund të shkallëzohet pa shkatërruar planetin.
Udhëtimi nga modeli McCulloch-Pitts i vitit 1943 te transformatorët dhe rrjetet pa peshë tregon se efikasiteti është kufiri i ri. Ndërsa mësimi i thellë klasik na dha fuqinë për të gjeneruar tekst dhe imazhe, optimizimi përmes arkitekturave të thjeshtuara dhe tabelave të kërkimit do të na lejojë të integrojmë inteligjencën artificiale në çdo objekt të përditshëm, duke i dhënë përparësi privatësisë dhe kursimit të energjisë mbi fuqinë brutale llogaritëse.