- Estructura fonamental de les xarxes neuronals basada en capes dentrada, ocultes i sortida que processen dades mitjançant funcions dactivació.
- Mecanismes daprenentatge supervisat centrats en el forward propagation i loptimització derrors mitjançant backpropagation i descens del gradient.
- Sorgiment d'arquitectures eficients com ara les xarxes lleugeres i els models sense pesos que eliminen les multiplicacions costoses per reduir el consum energètic.
Si mai t'has preguntat què hi ha darrere de la màgia de la intel·ligència artificial, la resposta curta és que intentem imitar el funcionament del cervell humà . Imagina una xarxa complexíssima de cèl·lules anomenades neurones que es passen espurnes elèctrics perquè puguem entendre el món; doncs bé, els informàtics han creat una versió de programari, amb nodes i algorismes, per resoldre problemes matemàtics que a nosaltres ens costarien hores.
Al món de la IA, no tot és igual. Hem passat de models senzills a xarxes neuronals profundes que manegen milions de connexions, i ara estem traient el cap cap a arquitectures que busquen ser molt més sostenibles i ràpides, trencant amb esquemes que feia dècades que usem. Desgranarem tot això perquè no et quedi cap dubte.
L'estructura bàsica d'una xarxa neuronal

Perquè una xarxa funcioni, normalment s'organitza en tres tipus de capes. Primer tenim la capa d'entrada , que és on entren les dades de l'exterior; aquí els nodes s'encarreguen d'analitzar i classificar la informació abans d'enviar-la al nivell següent. Després vénen les capes ocultes , que poden ser una sola o milers en el cas del deep learning. Aquestes capes són les que fan la feina bruta, processant la sortida de l'anterior per extreure'n patrons.
Finalment, arribem a la capa de sortida , que ens dóna el resultat final. Depenent del que busquem, hi pot haver un sol node (com en un sí o no) o diversos si estem davant d'un problema de classificació multiclasse . A les xarxes profundes, la clau està en els pesos , uns números que indiquen si una neurona estimula o inhibeix una altra, determinant així la influència de cada connexió en el resultat final.
El procés d'aprenentatge: De la teoria a la pràctica

Aprendre no és res més que ajustar aquests pesos per no equivocar-se. El primer pas és el Forward Propagation , que és bàsicament el viatge de les dades des de l'esquerra cap a la dreta de la xarxa. Les neurones realitzen una suma ponderada de les entrades , afegeixen un paràmetre anomenat bias (per donar més flexibilitat algebraica) i passen el resultat per una funció d'activació.
Parlem d'aquestes funcions perquè són les que eviten que la xarxa sigui una simple regressió lineal. Les més comunes són la funció Sigmoide , que torna valors entre 0 i 1 (ideal per a probabilitats), i la funció ReLu , que és la reina del deep learning perquè és senzillíssima i evita que el gradient desaparegui durant l'entrenament.
La màgia del Backpropagation i el Descens del Gradent
Quan la xarxa falla, entra en joc el Backpropagation . Aquí el procés és al revés: anem de la sortida cap a lentrada per calcular lerror. Fem servir funcions com l' Error Quadràtic Mitjà (MSE) per saber quant ens hem desviat de la realitat. A partir d'aquí, apliquem el descens del gradient que ens diu en quina direcció ajustar els pesos per minimitzar aquest error.
Un punt crític aquí és el learning rate o taxa daprenentatge. Si és molt alta, la xarxa aprèn ràpid però es pot passar del punt òptim i tornar-se imprecisa; si és molt baixa, el procés és etern i potser mai acabi d'aprendre. És un equilibri delicat que defineix la qualitat de l'entrenament.
Evolució cap a la IA sostenible: Xarxes lleugeres i models sense pesos
El problema del deep learning actual és que consumeix una quantitat denergia brutal a causa dels milers de milions de multiplicacions que realitza. Per això han sorgit les xarxes neuronals lleugeres , que usen tècniques com el pruning o podat per eliminar connexions innecessàries i reduir l'empremta energètica sense perdre massa potència.
Però el veritable salt disruptiu arriba amb les xarxes neuronals sense pesos , investigades per experts com Lizy K. John. En lloc de multiplicar entrades per pesos, utilitzen taules de cerca interconnectades amb dades binàries. Això és un canvi de paradigma total: passem de fer càlculs aritmètics costosos a fer consultes ràpides, cosa que permet que la xarxa sigui fins a 1.000 vegades més petita i eficient.
Aplicacions reals i futur de l'Edge Computing

Aquestes arquitectures ultraeficients són or pur per a l' Edge Computing , on el processament ocorre directament al dispositiu i no al núvol. Imagina sensors mèdics que monitoritzen l'ECG o la pressió arterial en temps real sense esgotar la bateria en minuts, o sistemes de detecció de paraules clau (com els d'Alexa) que consumeixen una fracció dels nanojuliols actuals.
A més, en l'àmbit industrial, l'optimització de la refrigeració en centres de dades mitjançant models lleugers ha aconseguit reduir el consum energètic fins a un 30%. La tendència és clara: ja no busquem només models més grans, sinó una IA més responsable que pugui escalar sense destruir el planeta.
El camí recorregut des del model de McCulloch-Pitts del 1943 fins als transformadors i les xarxes sense pes demostra que l'eficiència és la nova frontera. Mentre que l'aprenentatge profund clàssic ens va donar la potència per generar text i imatges, l'optimització a través d' arquitectures simplificades i taules de cerca ens permetrà integrar la intel·ligència artificial a qualsevol objecte quotidià, prioritzant la privadesa i l'estalvi energètic sobre la força bruta computacional.