- Техничка разлика између модела отворене тежине и правог отвореног кода у вештачкој интелигенцији.
- Стратешке паралеле између масовног усвајања Кубернетеса у контејнерима и тренутног тренда ка отвореним моделима.
- Практична имплементација оптимизованих архитектура инференције коришћењем vLLM и KubeAI у облачним окружењима.
- Геополитички и економски утицај демократизације тежине модела наспрам контроле затворених лабораторија.

Осврћући се на 2015. годину, свако ко је желео да постави дистрибуирани систем суочио се са дилемом. Ту је био Apache Mesos, већ добро успостављен и преферирани избор гиганата попут Твитера и Airbnb-а, а са друге стране, Docker Swarm, који је био много једноставнији и познатији. Усред свега овога, појавио се нови систем под називом Kubernetes, који је покренуо Google. У то време, преовлађујуће мишљење је било да је Mesos намењен правој инфраструктури, а да Kubernetes није ништа више од играчке. Чак је и Amazon одлучио да покрене сопствени ECS уместо да се придружи популарним платформама. Али сви знамо како се та прича завршила.
Кубернетес није победио зато што је у то време био најнапреднија технологија, већ зато што је успео да постане центар гравитације индустрије . Трансформисао се у неутралну основу на којој су добављачи услуга у облаку, инжењери и продавци могли да граде без страха. Када је достигао ту критичну масу, иновације су експлодирале: складиштење, безбедност и видљивост почели су да се решавају захваљујући заједници. Данас видимо како екосистем вештачке интелигенције понавља потпуно исти сценарио, а они који схвате овај образац моћи ће да доносе много информисаније технолошке одлуке.
Отворени пезоси или отворени код? То није иста ствар

Да бисмо избегли забуну, хајде да разјаснимо неке концепте. Многи људи називају моделе „отвореним кодом“ када су они заправо отворено-тежински . То значи да можете преузети претходно обучене параметре, подесити их и покренути где год желите, али немате приступ подацима за обуку или целом процесу креирања. Иницијатива отвореног кода (OSI) је много строжа: за њих, отворена вештачка интелигенција мора да укључује код за обуку и коришћени скуп података.
За адвоката, ова разлика је фундаментална, али просечног програмера није заправо брига све док алат ради и може се прилагодити. То је као да упоређујете Кубернетес (потпуно отвореног кода) са бинарним Линукс дистрибуцијама; добијате компајлирани артефакт и можете га модификовати, иако је оригинални процес изградње у власништву творца. На крају крајева, заједница даје приоритет употребљивости у односу на чистоћу лиценце, узимајући у обзир аспекте као што су одговорност у вештачкој интелигенцији и њени етички изазови.
Екосистем је већ овде и креће се пуном брзином.

Брзина којом ово окружење расте је запањујућа. HuggingFace већ хостује милионе модела, а око породица попут Llama, Mistral, Qwen и Gemma развија се све што се може замислити: од квантизованих верзија за покретање на мобилним уређајима или Apple Silicon-у, до LoRa адаптера специјализованих за право, медицину или програмирање. Штавише, појавила су се окружења за извршавање попут vLLM и SGLang која управљају високоперформансним закључивањем кроз континуирано групирање, док вам Ollama омогућава да покренете модел локално једном командом.
Било је време када је аргумент против модела отвореног кода био да не могу да се такмиче са GPT-4 или Claude. Међутим, та разлика је скоро потпуно затворена. Модели попут GLM-5.2 или Kimi K3 показују врхунске перформансе , посебно у сложеним кодним задацима, понекад надмашују верзије затвореног кода у одређеним бенчмарковима. Када су модели отвореног кода „довољно добри“, мрежни ефекат који је покренуо Kubernetes почиње да делује незаустављивом силом.
Директне паралеле: Од контејнера до вештачке интелигенције
Ако анализирамо структуру, аналогија је готово тачна. Основни модели (Llama, Qwen) делују као Docker AI: они пружају стандардизовану почетну тачку коју сваки програмер може да преузме и прилагоди, баш као што смо то урадили са Ubuntu или Alpine сликама. У међувремену, алати попут Ollama или llama.cpp испуњавају функцију Docker Compose-а, чинећи интеграцију модела у локално развојно окружење једноставном као додавање PostgreSQL контејнера.
Следећи корак је слој стандарда, еквивалент Кубернетеса. Иако се још увек дефинише, већ можемо видети делове: GGUF или GPTQ формати делују као OCI слике, OpenAI-компатибилни API је стандардни интерфејс, а Hugging Face је Docker Hub за моделе. Ко год успе да савлада овај слој услуга и имплементације, искористиће већину иновација у индустрији.
Практична имплементација у Кубернетесу
За оне који раде са Јавом и Спринг Бутом, ово је пресудни тренутак. Захваљујући оквирима као што су Спринг АИ и ЛангЧејн4ј, сада је могуће развијати на локалном моделу, а затим мигрирати на продукцијски кластер једноставном променом својства у конфигурационој датотеци. Више се не ослањамо на екстерне АПИ кључеве или податке који напуштају нашу мрежу, што је од виталног значаја за секторе попут банкарства и здравства где је приватност података најважнија.
Са техничке тачке гледишта, постоје два главна пута за имплементацију на Kubernetes-у (тачније на GKE). С једне стране, можемо директно користити vLLM као механизам за закључивање како бисмо стекли максималну контролу над перформансама. С друге стране, можемо се одлучити за KubeAI, нативну Kubernetes платформу за управљање моделима. KubeAI вам омогућава управљање каталогом модела и нуди функције попут скалирања до нуле , што смањује оперативне трошкове тако што не држи графичке процесоре укљученим када нема захтева, иако уводи извесну латенцију хладног покретања.
Економска и геополитичка дебата
Није све технички оптимизам; у току је хладни рат. Кинески модели импресивно добијају на значају у преузимањима, што наводи неке секторе у САД да разматрају ограничења. Међутим, технички је готово немогуће забранити модел на основу његовог порекла, јер су тежине једноставно бројеви и не носе ознаку националности. Сваки наиван покушај забране био би лако заобићи.
Штавише, постоји економска тензија. Неки стручњаци тврде да су модели отвореног пондерисања „успоравајући“ јер, смањењем вредности коју граничне лабораторије могу да остваре, могли би да обесхрабре масовна улагања у инфраструктуру (CAPEX). Ако улагање од 700.000 милијарди долара не гарантује монопол на профит, капитал би могао бити повучен. Међутим, историја нам говори да отворена стандардизација често убрзава масовно усвајање, смањујући трошкове уласка за хиљаде стартапова.
Ако сте програмер и не желите да заостанете, идеалан приступ је да почнете да експериментишете са локално квантизованим моделима. Не треба вам масивна графичка картица (GPU), јер формати попут Q4 омогућавају 7B моделу да прихватљиво ради на модерним процесорима. Кључно је користити интерфејсе компатибилне са OpenAI , јер је то де факто стандард, без обзира да ли користите vLLM, SGLang или LocalAI. Коначно, разумевање разлике између формата квантизације (као што су Q4_K_M или Q8_0) омогућиће вам да оптимизујете коришћење RAM меморије и брзину одзива ваших апликација.
Историја рачунарства нас је научила да отворене платформе које омогућавају масовно прилагођавање на крају надмашују било ког затвореног добављача, без обзира на ресурсе овог другог. Тренутно доживљавамо Кубернетес еру вештачке интелигенције, где могућност покретања прилагођених модела на контролисаној инфраструктури враћа технолошки суверенитет програмерима и предузећима.

