- Ang pangunahing istruktura ng mga neural network batay sa input, hidden, at output layer na nagpoproseso ng data sa pamamagitan ng mga activation function.
- Mga pinangangasiwaang mekanismo ng pagkatuto na nakatuon sa forward propagation at error optimization sa pamamagitan ng backpropagation at gradient descent.
- Paglitaw ng mga mahusay na arkitektura tulad ng mga magaan na network at mga walang bigat na modelo na nag-aalis ng mga magastos na multiplikasyon upang mabawasan ang pagkonsumo ng enerhiya.
Kung naisip mo na kung ano ang nasa likod ng mahika ng artificial intelligence, ang maikling sagot ay sinusubukan nating gayahin ang paggana ng utak ng tao . Isipin ang isang napakakumplikadong network ng mga selula na tinatawag na neuron na nagpapadala ng mga electrical impulse sa isa't isa upang maunawaan natin ang mundo; bueno, ang mga computer scientist ay lumikha ng isang bersyon ng software, na may mga node at algorithm, upang malutas ang mga problemang matematikal na aabutin ng ilang oras.
Sa mundo ng AI, hindi lahat ay pareho. Mula sa mga simpleng modelo, lumipat tayo sa malalalim na neural network na namamahala ng milyun-milyong koneksyon, at ngayon ay naghahanap tayo ng mga arkitektura na naglalayong maging mas napapanatiling at mas mabilis, na binabago ang mga paradigma na ginagamit natin sa loob ng mga dekada. Suriin natin ang lahat ng ito para wala kang pag-aalinlangan.
Ang pangunahing istruktura ng isang neural network

Para gumana ang isang network, karaniwan itong nakaayos sa tatlong uri ng layer. Una, nariyan ang input layer , kung saan pumapasok ang data mula sa labas; dito, sinusuri at inuuri ng mga node ang impormasyon bago ito ipadala sa susunod na antas. Pagkatapos ay ang mga nakatagong layer , na maaaring isang layer o libu-libo sa kaso ng deep learning. Ang mga layer na ito ang gumagawa ng mabibigat na gawain, pinoproseso ang output ng nakaraang layer upang kumuha ng mga pattern.
Sa wakas, makakarating tayo sa output layer , na nagbibigay sa atin ng pangwakas na resulta. Depende sa ating hinahanap, maaaring mayroong isang node (tulad ng sa isang tanong na oo/hindi) o ilan kung tayo ay humaharap sa isang problema sa klasipikasyon ng multiclass . Sa mga malalalim na network, ang susi ay nasa mga timbang , mga numerong nagpapahiwatig kung ang isang neuron ay nagpapasigla o pumipigil sa isa pa, kaya tinutukoy ang impluwensya ng bawat koneksyon sa pangwakas na resulta.
Ang proseso ng pagkatuto: Mula sa teorya hanggang sa pagsasagawa

Ang pagkatuto ay simpleng pagsasaayos ng mga timbang na ito upang maiwasan ang mga pagkakamali. Ang unang hakbang ay ang forward propagation , na mahalagang ang data na naglalakbay mula kaliwa patungo sa kanang bahagi ng network. Ang mga neuron ay nagsasagawa ng weighted sum ng mga input , nagdaragdag ng isang parameter na tinatawag na bias (upang magbigay ng higit na algebraic flexibility), at ipinapasa ang resulta sa pamamagitan ng isang activation function.
Pag-usapan natin ang mga function na ito, dahil ang mga ito ang pumipigil sa network na maging isang simpleng linear regression. Ang pinakakaraniwan ay ang Sigmoid function , na nagbabalik ng mga halaga sa pagitan ng 0 at 1 (mainam para sa mga probabilidad), at ang ReLu function , na siyang reyna ng deep learning dahil ito ay napakasimple at pumipigil sa pagkawala ng gradient habang nagsasanay.
Ang mahika ng backpropagation at gradient descent
Kapag nabigo ang network, ginagamit ang backpropagation . Dito, nababaligtad ang proseso: gagawa tayo mula sa output patungo sa input upang kalkulahin ang error. Gumagamit tayo ng mga function tulad ng Mean Squared Error (MSE) upang matukoy kung gaano tayo lumihis mula sa inaasahang halaga. Mula doon, inilalapat natin ang gradient descent , na nagsasabi sa atin kung saang direksyon dapat ayusin ang mga weight upang mabawasan ang error na iyon.
Ang isang kritikal na punto rito ay ang bilis ng pagkatuto . Kung ito ay masyadong mataas, mabilis na natututo ang network ngunit maaaring lumampas sa pinakamainam na punto at maging hindi tumpak; kung ito ay masyadong mababa, ang proseso ay walang katapusan at maaaring hindi na ito matapos sa pagkatuto. Ito ay isang maselang balanse na tumutukoy sa kalidad ng pagsasanay.
Ebolusyon tungo sa napapanatiling AI: Mga magaan na network at mga modelong walang bigat
Ang problema sa kasalukuyang deep learning ay ang pagkonsumo nito ng napakalaking enerhiya dahil sa bilyun-bilyong multiplikasyon na ginagawa nito. Ito ang dahilan kung bakit lumitaw ang mga magaan na neural network , gamit ang mga pamamaraan tulad ng pagpuputol upang maalis ang mga hindi kinakailangang koneksyon at mabawasan ang kanilang energy footprint nang hindi isinasakripisyo ang labis na processing power.
Ngunit ang tunay na nakakagambalang hakbang ay nagmumula sa mga weightless neural network , na sinaliksik ng mga eksperto tulad ni Lizy K. John. Sa halip na paramihin ang mga input sa mga weight, gumagamit sila ng magkakaugnay na lookup table na may binary data. Ito ay isang kumpletong pagbabago sa paradigma: mula sa pagsasagawa ng magastos na mga kalkulasyon sa aritmetika, lumilipat tayo sa pagsasagawa ng mabibilis na query, na nagpapahintulot sa network na maging hanggang 1.000 beses na mas maliit at mas mahusay.
Mga aplikasyon sa totoong mundo at kinabukasan ng Edge Computing

Ang mga ultra-episyenteng arkitekturang ito ay purong ginto para sa edge computing , kung saan ang pagproseso ay direktang nangyayari sa device, hindi sa cloud. Isipin ang mga medical sensor na nagmomonitor ng ECG o presyon ng dugo nang real time nang hindi nauubos ang baterya sa loob ng ilang minuto, o mga keyword detection system (tulad ng kay Alexa) na kumokonsumo ng isang bahagi lamang ng mga nanojoules ngayon.
Bukod pa rito, sa sektor ng industriya, ang pag-optimize ng pagpapalamig sa mga data center gamit ang mga magaan na modelo ay nakapagbawas ng pagkonsumo ng enerhiya nang hanggang 30%. Malinaw ang trend: hindi na lamang tayo naghahanap ng mas malalaking modelo, kundi para sa mas responsableng AI na maaaring lumawak nang hindi sinisira ang planeta.
Ang paglalakbay mula sa modelong McCulloch-Pitts noong 1943 patungo sa mga weightless transformer at network ay nagpapakita na ang kahusayan ang bagong hangganan. Bagama't ang klasikal na deep learning ay nagbigay sa atin ng kapangyarihang bumuo ng teksto at mga imahe, ang pag-optimize sa pamamagitan ng pinasimpleng mga arkitektura at mga lookup table ay magbibigay-daan sa atin na isama ang artificial intelligence sa anumang pang-araw-araw na bagay, na inuuna ang privacy at pagtitipid ng enerhiya kaysa sa brutal na computational power.