- Tehniskā atšķirība starp atvērtā svara modeļiem un patiesi atvērtā pirmkoda modeļiem mākslīgajā intelektā.
- Stratēģiskas paralēles starp Kubernetes masveida ieviešanu konteineros un pašreizējo tendenci uz atvērtiem modeļiem.
- Optimizētu secinājumu arhitektūru praktiska ieviešana, izmantojot vLLM un KubeAI mākoņvidē.
- Modeļu svara demokratizācijas pretstatā slēgtu laboratoriju kontrolei ģeopolitiskā un ekonomiskā ietekme.

Atskatoties uz 2015. gadu, ikviens, kurš vēlējās izveidot izkliedētu sistēmu, saskārās ar dilemmu. Pastāvēja Apache Mesos, kas jau bija labi izveidots un bija tādu gigantu kā Twitter un Airbnb iecienītākā izvēle, un Docker Swarm, kas bija daudz vienkāršāks un pazīstamāks. Visa šī procesa vidū parādījās jaunpienācējs ar nosaukumu Kubernetes, ko laida klajā Google. Toreiz valdīja uzskats, ka Mesos ir paredzēts īstai infrastruktūrai un ka Kubernetes ir tikai rotaļlieta. Pat Amazon nolēma palaist savu elektronisko sakaru sistēmu (ECS), nevis pievienoties šai tendencei. Bet mēs visi zinām, kā šis stāsts beidzās.
Kubernetes neuzvarēja tāpēc, ka tā bija tolaik vismodernākā tehnoloģija, bet gan tāpēc, ka tai izdevās kļūt par nozares smaguma centru . Tā pārtapa par neitrālu pamatu, uz kura mākoņpakalpojumu sniedzēji, inženieri un pārdevēji varēja bez bailēm veidot savu biznesu. Kad tā sasniedza kritisko masu, inovācijas eksplodēja: pateicoties kopienai, sāka risināt krātuves, drošības un novērojamības problēmas. Šodien mēs redzam, ka mākslīgā intelekta ekosistēma atkārto tieši to pašu scenāriju, un tie, kas izpratīs šo modeli, varēs pieņemt daudz pamatotākus lēmumus par tehnoloģijām.
Atvērtie peso vai atvērtā koda programmatūra? Tie nav viens un tas pats

Lai izvairītos no neskaidrībām, precizēsim dažus jēdzienus. Daudzi cilvēki modeļus sauc par "atvērtā pirmkoda" modeļiem, ja tie patiesībā ir atvērtā svēruma modeļi . Tas nozīmē, ka varat lejupielādēt iepriekš apmācītus parametrus, pielāgot tos un palaist tos, kur vien vēlaties, taču jums nav piekļuves apmācības datiem vai visam izveides procesam. Atvērtā pirmkoda iniciatīva (OSI) ir daudz stingrāka: viņiem atvērtajam mākslīgajam intelektam ir jāietver apmācības kods un izmantotais datu kopums.
Juristam šī atšķirība ir būtiska, taču vidusmēra izstrādātājam tā īsti nerūp, ja vien rīks darbojas un ir pielāgojams. Tas ir līdzīgi kā salīdzināt Kubernetes (pilnībā atvērtā koda) ar binārajiem Linux distribūcijām; jūs saņemat kompilēto artefaktu un varat to modificēt, pat ja sākotnējais būvēšanas cauruļvads pieder veidotājam. Galu galā kopiena prioritāri vērtē lietojamību, nevis licences tīrību, ņemot vērā tādus aspektus kā atbildība mākslīgā intelekta jomā un tā ētiskās problēmas.
Ekosistēma jau pastāv, un tā virzās pilnā ātrumā.
Ātrums, ar kādu šī vide aug, ir pārsteidzošs. HuggingFace jau mitina miljoniem modeļu, un ap tādām saimēm kā Llama, Mistral, Qwen un Gemma tiek izstrādāts viss iedomājamais: sākot ar kvantizētām versijām, kas paredzētas darbībai mobilajās ierīcēs vai Apple Silicon, līdz LoRA adapteriem, kas specializējas jurisprudencē, medicīnā vai programmēšanā. Turklāt ir parādījušās tādas izpildlaika vides kā vLLM un SGLang, kas pārvalda augstas veiktspējas secinājumus, izmantojot nepārtrauktu pakešapstrādi, savukārt Ollama ļauj palaist modeli lokāli ar vienu komandu.
Bija laiks, kad arguments pret atvērtā pirmkoda modeļiem bija tāds, ka tie nevar konkurēt ar GPT-4 vai Claude. Tomēr šī plaisa ir gandrīz pilnībā izzudusi. Tādi modeļi kā GLM-5.2 vai Kimi K3 demonstrē visprogresīvāko veiktspēju , īpaši sarežģītos koda uzdevumos, dažkārt pārspējot slēgtā pirmkoda versijas noteiktos etalonos. Kad atvērtā pirmkoda modeļi ir "pietiekami labi", tīkla efekts, kas virzīja Kubernetes, sāk darboties ar neapturamu spēku.
Tiešas paralēles: no konteineriem līdz mākslīgajam intelektam
Analizējot struktūru, analoģija ir gandrīz precīza. Bāzes modeļi (Llama, Qwen) darbojas kā mākslīgā intelekta Docker: tie nodrošina standartizētu sākumpunktu , ko jebkurš izstrādātājs var lejupielādēt un pielāgot, tāpat kā mēs to darījām ar Ubuntu vai Alpine attēliem. Tikmēr tādi rīki kā Ollama vai llama.cpp pilda Docker Compose funkciju, padarot modeļa integrēšanu lokālajā izstrādes vidē tikpat vienkāršu kā PostgreSQL konteinera pievienošanu.
Nākamais solis ir standartu slānis, kas ir Kubernetes ekvivalents. Lai gan tas vēl tiek definēts, mēs jau varam redzēt tā daļas: GGUF vai GPTQ formāti darbojas kā OCI attēli, ar OpenAI saderīgā API ir standarta saskarne, un Hugging Face ir Docker Hub modeļiem. Ikviens, kam izdosies apgūt šo pakalpojumu un izvietošanas slāni, iegūs lielāko daļu nozares inovāciju.
Praktiska ieviešana Kubernetes vidē
Tiem, kas strādā ar Java un Spring Boot, šis ir izšķirošs brīdis. Pateicoties tādiem ietvariem kā Spring AI un LangChain4j, tagad ir iespējams izstrādāt lokālu modeli un pēc tam migrēt uz ražošanas klasteri, vienkārši mainot īpašību konfigurācijas failā. Mēs vairs nepaļaujamies uz ārējām API atslēgām vai datiem, kas pamet mūsu tīklu, kas ir ļoti svarīgi tādām nozarēm kā banku darbība un veselības aprūpe, kur datu privātums ir ārkārtīgi svarīgs.
No tehniskā viedokļa ir divi galvenie ceļi, kā izvietot Kubernetes (īpaši GKE). No vienas puses, mēs varam izmantot vLLM tieši kā secinājumu dzinēju, lai iegūtu maksimālu kontroli pār veiktspēju. No otras puses, mēs varam izvēlēties KubeAI, vietējo Kubernetes platformu modeļu pārvaldībai. KubeAI ļauj pārvaldīt modeļu katalogu un piedāvā tādas funkcijas kā mērogošana līdz nullei , kas samazina ekspluatācijas izmaksas, neieslēdzot GPU, ja nav pieprasījumu, lai gan tas rada zināmu aukstās palaišanas latentumu.
Ekonomiskās un ģeopolitiskās debates
Tas nav tikai tehnisks optimisms; notiek aukstais karš. Ķīnas modeļi lejupielāžu ziņā gūst iespaidīgu popularitāti, liekot dažām nozarēm ASV apsvērt ierobežojumus. Tomēr tehniski ir gandrīz neiespējami aizliegt modeli, pamatojoties uz tā izcelsmi, jo svari ir tikai skaitļi un tiem nav tautības marķējuma. Jebkuru naivu mēģinājumu aizliegt būtu viegli apiet.
Turklāt pastāv ekonomiska spriedze. Daži eksperti apgalvo, ka atvērtie svēršanas modeļi ir "palēninoši", jo, samazinot vērtību, ko var iegūt jaunattīstības laboratorijas, tie varētu atturēt no lieliem ieguldījumiem infrastruktūrā (CAPEX). Ja 700.000 miljardu dolāru investīcijas negarantē peļņas monopolu, kapitāls varētu tikt atņemts. Tomēr vēsture liecina, ka atvērtā standartizācija bieži vien paātrina masveida ieviešanu, samazinot ienākšanas izmaksas tūkstošiem jaunuzņēmumu.
Ja esat izstrādātājs un nevēlaties atpalikt, ideāla pieeja ir sākt eksperimentēt ar lokāli kvantētiem modeļiem. Jums nav nepieciešama milzīga grafikas procesora jauda, jo tādi formāti kā Q4 ļauj 7B modelim pieņemami darboties mūsdienu procesoros. Ir svarīgi izmantot saskarnes, kas ir saderīgas ar OpenAI , jo tas ir de facto standarts neatkarīgi no tā, vai izmantojat vLLM, SGLang vai LocalAI. Visbeidzot, izpratne par atšķirību starp kvantēšanas formātiem (piemēram, Q4_K_M vai Q8_0) ļaus jums optimizēt RAM izmantošanu un lietojumprogrammu atsaucību.
Datorzinātņu vēsture mums ir iemācījusi, ka atvērtās platformas, kas nodrošina masveida pielāgošanu, galu galā pārspēj jebkuru slēgta tipa piegādātāju neatkarīgi no pēdējā resursiem. Pašlaik mēs piedzīvojam mākslīgā intelekta Kubernetes ēru, kur spēja darbināt pielāgotus modeļus kontrolētā infrastruktūrā atgriež tehnoloģisko suverenitāti izstrādātājiem un uzņēmumiem.


