- Tehnička razlika između modela otvorene težine i pravog otvorenog koda u umjetnoj inteligenciji.
- Strateške paralele između masovnog usvajanja Kubernetesa u kontejnerima i trenutnog trenda prema otvorenim modelima.
- Praktična implementacija optimiziranih arhitektura zaključivanja korištenjem vLLM-a i KubeAI-a u cloud okruženjima.
- Geopolitički i ekonomski utjecaj demokratizacije težine modela nasuprot kontroli zatvorenih laboratorija.

Osvrćući se na 2015. godinu, svatko tko je želio postaviti distribuirani sustav suočio se s dilemom. Tu je bio Apache Mesos, već dobro etabliran i preferirani izbor divova poput Twittera i Airbnba, a s druge strane, Docker Swarm, koji je bio puno jednostavniji i poznatiji. Usred svega toga pojavio se novajlija pod nazivom Kubernetes, kojeg je pokrenuo Google. U to vrijeme prevladavalo je mišljenje da je Mesos namijenjen pravoj infrastrukturi, a da je Kubernetes samo igračka. Čak je i Amazon odlučio pokrenuti vlastiti ECS umjesto da se pridruži popularnim sustavima. Ali svi znamo kako je ta priča završila.
Kubernetes nije pobijedio zato što je u to vrijeme bio najnaprednija tehnologija, već zato što je uspio postati težište industrije . Transformirao se u neutralni temelj na kojem su pružatelji usluga u oblaku, inženjeri i dobavljači mogli graditi bez straha. Nakon što je dosegao tu kritičnu masu, inovacije su eksplodirale: pohrana, sigurnost i vidljivost počeli su se rješavati zahvaljujući zajednici. Danas vidimo ekosustav umjetne inteligencije koji ponavlja potpuno isti scenarij, a oni koji shvate ovaj obrazac moći će donositi puno informiranije tehnološke odluke.
Otvoreni pezosi ili otvoreni kod? To nije ista stvar.

Kako bismo izbjegli zabunu, razjasnimo neke koncepte. Mnogi ljudi modele nazivaju "otvorenim kodom" kada su oni zapravo otvoreno ponderirani . To znači da možete preuzeti prethodno obučene parametre, prilagoditi ih i pokrenuti gdje god želite, ali nemate pristup podacima za obuku ili cijelom procesu stvaranja. Inicijativa otvorenog koda (OSI) je mnogo stroža: za njih otvorena umjetna inteligencija mora uključivati kod za obuku i korišteni skup podataka.
Za odvjetnika je ova razlika temeljna, ali prosječnog programera nije briga sve dok alat radi i može se prilagoditi. To je kao da uspoređujete Kubernetes (potpuno otvorenog koda) s binarnim Linux distribucijama; primate kompajlirani artefakt i možete ga mijenjati, iako je izvorni cjevovod izgradnje u vlasništvu kreatora. U konačnici, zajednica daje prioritet upotrebljivosti nad čistoćom licence, uzimajući u obzir aspekte poput odgovornosti u umjetnoj inteligenciji i njezinih etičkih izazova.
Ekosustav je već ovdje i kreće se punom brzinom.
Brzina kojom ovo okruženje raste je zapanjujuća. HuggingFace već sadrži milijune modela, a oko obitelji poput Llama, Mistral, Qwen i Gemma razvija se sve zamislivo: od kvantiziranih verzija za pokretanje na mobilnim uređajima ili Apple Siliconu, do LoRA adaptera specijaliziranih za pravo, medicinu ili programiranje. Nadalje, pojavila su se okruženja za izvođenje poput vLLM i SGLang koja upravljaju visokoučinkovitim zaključivanjem putem kontinuiranog batchinga, dok Ollama omogućuje lokalno pokretanje modela jednom naredbom.
Nekad je argument protiv modela otvorenog koda bio da se ne mogu natjecati s GPT-4 ili Claudeom. Međutim, ta je razlika gotovo u potpunosti smanjena. Modeli poput GLM-5.2 ili Kimi K3 pokazuju vrhunske performanse , posebno u složenim kodnim zadacima, ponekad nadmašujući verzije zatvorenog koda u određenim testovima. Kada su modeli otvorenog koda "dovoljno dobri", mrežni efekt koji je pokretao Kubernetes počinje djelovati nezaustavljivom silom.
Izravne paralele: Od kontejnera do umjetne inteligencije
Ako analiziramo strukturu, analogija je gotovo točna. Osnovni modeli (Llama, Qwen) djeluju kao Docker umjetne inteligencije: oni pružaju standardiziranu početnu točku koju bilo koji programer može preuzeti i prilagoditi, baš kao što smo to učinili s Ubuntu ili Alpine slikama. U međuvremenu, alati poput Ollame ili llama.cpp ispunjavaju funkciju Docker Composea, čineći integraciju modela u lokalno razvojno okruženje jednostavnom kao dodavanje PostgreSQL kontejnera.
Sljedeći korak je sloj standarda, ekvivalent Kubernetesa. Iako se još uvijek definira, već možemo vidjeti dijelove: GGUF ili GPTQ formati djeluju kao OCI slike, OpenAI-kompatibilni API je standardno sučelje, a Hugging Face je Docker Hub za modele. Tko god uspije savladati ovaj sloj usluga i implementacije, uhvatit će većinu inovacija u industriji.
Praktična implementacija u Kubernetes-u
Za one koji rade s Javom i Spring Bootom, ovo je ključni trenutak. Zahvaljujući okvirima poput Spring AI-a i LangChain4j-a, sada je moguće razvijati na lokalnom modelu, a zatim migrirati na produkcijski klaster jednostavnom promjenom svojstva u konfiguracijskoj datoteci. Više se ne oslanjamo na vanjske API ključeve ili podatke koji napuštaju našu mrežu, što je ključno za sektore poput bankarstva i zdravstva gdje je privatnost podataka najvažnija.
S tehničkog stajališta, postoje dva glavna puta za implementaciju na Kubernetes (posebno na GKE). S jedne strane, možemo izravno koristiti vLLM kao mehanizam za zaključivanje kako bismo postigli maksimalnu kontrolu nad performansama. S druge strane, možemo se odlučiti za KubeAI, izvornu Kubernetes platformu za upravljanje modelima. KubeAI vam omogućuje upravljanje katalogom modela i nudi značajke poput skaliranja na nulu , što smanjuje operativne troškove tako što ne drži GPU-ove uključenima kada nema zahtjeva, iako uvodi određenu latenciju hladnog pokretanja.
Ekonomska i geopolitička debata
Nije sve tehnički optimizam; u tijeku je hladni rat. Kineski modeli impresivno postižu uspjeh u preuzimanjima, što je navelo neke sektore u SAD-u da razmotre ograničenja. Međutim, tehnički je gotovo nemoguće zabraniti model na temelju njegovog podrijetla, budući da su težine samo brojevi i ne nose oznaku nacionalne pripadnosti. Svaki naivan pokušaj zabrane bilo bi lako zaobići.
Nadalje, postoji ekonomska napetost. Neki stručnjaci tvrde da su otvoreni modeli ponderiranja "usporavajući" jer smanjenjem vrijednosti koju granični laboratoriji mogu ostvariti mogu obeshrabriti masovna ulaganja u infrastrukturu (CAPEX). Ako ulaganje od 700.000 milijardi dolara ne jamči monopol na profit, kapital bi se mogao povući. Međutim, povijest nam govori da otvorena standardizacija često ubrzava masovno usvajanje, smanjujući troškove ulaska za tisuće startupa.
Ako ste programer i ne želite zaostati, idealan pristup je početi eksperimentirati s lokalno kvantiziranim modelima. Ne trebate masivni GPU, jer formati poput Q4 omogućuju 7B modelu prihvatljivo pokretanje na modernim CPU-ima. Ključno je koristiti sučelja kompatibilna s OpenAI-jem , jer je to de facto standard, bez obzira koristite li vLLM, SGLang ili LocalAI. Konačno, razumijevanje razlike između formata kvantizacije (kao što su Q4_K_M ili Q8_0) omogućit će vam optimizaciju korištenja RAM-a i brzine odziva vaših aplikacija.
Povijest računarstva nas je naučila da otvorene platforme koje omogućuju masovnu prilagodbu u konačnici nadmašuju bilo kojeg zatvorenog dobavljača, bez obzira na resurse potonjeg. Trenutno proživljavamo Kubernetes eru umjetne inteligencije, gdje mogućnost pokretanja prilagođenih modela na kontroliranoj infrastrukturi vraća tehnološki suverenitet programerima i tvrtkama.


