- Neironu tīklu pamatstruktūra, kuras pamatā ir ievades, slēptais un izvades slāņi, kas apstrādā datus, izmantojot aktivizācijas funkcijas.
- Uzraudzīti mācību mehānismi, kas vērsti uz tālāku izplatīšanos un kļūdu optimizāciju, izmantojot atpakaļizplatīšanos un gradienta nolaišanos.
- Efektīvu arhitektūru, piemēram, vieglu tīklu un bezsvara modeļu, parādīšanās, kas novērš dārgu reizināšanu, lai samazinātu enerģijas patēriņu.
Ja kādreiz esat domājuši, kas slēpjas aiz mākslīgā intelekta maģijas, īsā atbilde ir tāda, ka mēs cenšamies atdarināt cilvēka smadzeņu darbību . Iedomājieties ļoti sarežģītu šūnu tīklu, ko sauc par neironiem, kas sūta viens otram elektriskos impulsus, lai mēs varētu izprast pasauli; datorzinātnieki ir izveidojuši programmatūras versiju ar mezgliem un algoritmiem, lai atrisinātu matemātiskas problēmas, kuru risināšana mums prasītu stundas.
Mākslīgā intelekta pasaulē ne viss ir vienāds. Esam pārgājuši no vienkāršiem modeļiem uz dziļiem neironu tīkliem , kas pārvalda miljoniem savienojumu, un tagad meklējam arhitektūras, kuru mērķis ir būt daudz ilgtspējīgākām un ātrākām, laužot paradigmas, ko esam izmantojuši gadu desmitiem. Apskatīsim to visu sīkāk, lai jums nebūtu šaubu.
Neironu tīkla pamatstruktūra

Lai tīkls darbotos, tas parasti ir organizēts trīs veidu slāņos. Pirmais ir ievades slānis , kurā nonāk dati no ārpuses; šeit mezgli analizē un klasificē informāciju, pirms to nosūta uz nākamo līmeni. Pēc tam seko slēptie slāņi , kas var būt viens slānis vai tūkstošiem dziļās mācīšanās gadījumā. Šie slāņi veic smago darbu, apstrādājot iepriekšējā slāņa izvadi, lai iegūtu modeļus.
Visbeidzot, mēs nonākam pie izvades slāņa , kas sniedz mums gala rezultātu. Atkarībā no tā, ko mēs meklējam, var būt viens mezgls (kā jā/nē jautājumā) vai vairāki, ja mums ir darīšana ar daudzklases klasifikācijas problēmu . Dziļajos tīklos atslēga slēpjas svaros — skaitļos, kas norāda, vai viens neirons stimulē vai kavē citu, tādējādi nosakot katra savienojuma ietekmi uz gala rezultātu.
Mācību process: no teorijas līdz praksei

Mācīšanās ir vienkārši šo svaru pielāgošana, lai izvairītos no kļūdām. Pirmais solis ir tālāka izplatīšana , kas būtībā ir datu pārvietošanās no tīkla kreisās uz labo pusi. Neironi veic ievades datu svērto summēšanu , pievieno parametru, ko sauc par nobīdi (lai nodrošinātu lielāku algebrisko elastību), un rezultātu nodod caur aktivizācijas funkciju.
Parunāsim par šīm funkcijām, jo tieši tās neļauj tīklam būt vienkāršai lineārai regresijai. Visizplatītākās ir Sigmoid funkcija , kas atgriež vērtības no 0 līdz 1 (ideāli piemērota varbūtībām), un ReLu funkcija , kas ir dziļās mācīšanās karaliene, jo tā ir ļoti vienkārša un neļauj gradientam izzust apmācības laikā.
Atpakaļizplatīšanās un gradienta nolaišanās maģija
Kad tīkls neizdodas, tiek izmantota atpakaļizplatīšanās . Šeit process ir apgriezts: mēs strādājam no izejas uz ievadi, lai aprēķinātu kļūdu. Mēs izmantojam tādas funkcijas kā vidējā kvadrātiskā kļūda (MSE), lai noteiktu, cik lielā mērā esam novirzījušies no realitātes. Pēc tam mēs izmantojam gradienta nolaišanās metodi , kas norāda, kurā virzienā pielāgot svarus, lai samazinātu šo kļūdu.
Kritisks punkts šeit ir mācīšanās ātrums . Ja tas ir pārāk augsts, tīkls mācās ātri, bet var pārsniegt optimālo punktu un kļūt neprecīzs; ja tas ir pārāk zems, process ir bezgalīgs un mācīšanās var nekad nepabeigties. Tas ir delikāts līdzsvars, kas nosaka apmācības kvalitāti.
Evolūcija ilgtspējīga mākslīgā intelekta virzienā: vieglie tīkli un bezsvara modeļi
Problēma ar pašreizējām dziļās mācīšanās tehnoloģijām ir tā, ka tās patērē milzīgu enerģijas daudzumu, jo veic miljardus reizināšanas darbību. Tāpēc ir parādījušies vieglie neironu tīkli , kas izmanto tādas metodes kā apgriešanu , lai likvidētu nevajadzīgus savienojumus un samazinātu enerģijas patēriņu, neupurējot pārāk daudz apstrādes jaudas.
Taču īstais revolucionārais lēciens notiek ar bezsvara neironu tīkliem , ko pētījuši tādi eksperti kā Lizija K. Džona. Tā vietā, lai reizinātu ievades datus ar svariem, tie izmanto savstarpēji savienotas uzmeklēšanas tabulas ar bināriem datiem. Tā ir pilnīga paradigmas maiņa: mēs pārejam no dārgu aritmētisku aprēķinu veikšanas uz ātru vaicājumu veikšanu, ļaujot tīklam būt līdz pat 1.000 reizēm mazākam un efektīvākam.
Reālās pasaules pielietojumi un Edge Computing nākotne

Šīs īpaši efektīvās arhitektūras ir tīrs zelts perifērijas skaitļošanai , kur apstrāde notiek tieši ierīcē, nevis mākonī. Iedomājieties medicīniskos sensorus, kas reāllaikā uzrauga EKG vai asinsspiedienu, neiztukšojot akumulatoru dažu minūšu laikā, vai atslēgvārdu noteikšanas sistēmas (piemēram, Alexa), kas patērē niecīgu daļu no mūsdienu nanodžouliem.
Turklāt rūpniecības sektorā dzesēšanas optimizēšana datu centros, izmantojot vieglus modeļus, ir samazinājusi enerģijas patēriņu līdz pat 30 %. Tendence ir skaidra: mēs vairs nemeklējam tikai lielākus modeļus, bet gan atbildīgāku mākslīgo intelektu , kas var mērogoties, neiznīcinot planētu.
Ceļš no 1943. gada Makkalohas-Pitsa modeļa līdz bezsvara transformatoriem un tīkliem parāda, ka efektivitāte ir jaunā robeža. Lai gan klasiskā dziļā mācīšanās deva mums iespēju ģenerēt tekstu un attēlus, optimizācija, izmantojot vienkāršotas arhitektūras un uzmeklēšanas tabulas, ļaus mums integrēt mākslīgo intelektu jebkurā ikdienas objektā, prioritāti piešķirot privātumam un enerģijas taupīšanai, nevis brutālai skaitļošanas jaudai.