- Yapay zekada açık ağırlık modelleri ile gerçek açık kaynak kodlu modeller arasındaki teknik farklılık.
- Kubernetes'in konteynerlerde yaygın olarak benimsenmesi ile açık modellere doğru mevcut eğilim arasında stratejik paralellikler bulunmaktadır.
- Bulut ortamlarında vLLM ve KubeAI kullanılarak optimize edilmiş çıkarım mimarilerinin pratik uygulaması.
- Modellerin ağırlığının demokratikleşmesinin, kapalı laboratuvarların kontrolüne karşı jeopolitik ve ekonomik etkileri.

2015'e geri dönersek, dağıtık bir sistem kurmak isteyen herkes bir ikilemle karşı karşıyaydı. Bir yanda, Twitter ve Airbnb gibi devlerin tercih ettiği, zaten köklü bir geçmişe sahip Apache Mesos varken, diğer yanda çok daha basit ve tanıdık olan Docker Swarm vardı. Tüm bunların ortasında, Google tarafından piyasaya sürülen Kubernetes adında yeni bir oyuncu ortaya çıktı. O zamanlar, yaygın görüş Mesos'un gerçek altyapı için, Kubernetes'in ise bir oyuncaktan başka bir şey olmadığı yönündeydi. Hatta Amazon bile bu akıma katılmak yerine kendi ECS'sini piyasaya sürmeye karar verdi. Ama hepimiz bu hikayenin nasıl bittiğini biliyoruz.
Kubernetes, o zamanın en gelişmiş teknolojisi olduğu için değil, sektörün ağırlık merkezi haline gelmeyi başardığı için kazandı . Bulut sağlayıcılarının, mühendislerin ve satıcıların korkmadan üzerine inşa edebilecekleri tarafsız bir temel haline dönüştü. Bu kritik kütleye ulaştığında, inovasyon patladı: depolama, güvenlik ve gözlemlenebilirlik, topluluk sayesinde çözülmeye başlandı. Bugün, yapay zeka ekosisteminin aynı senaryoyu tekrarladığını görüyoruz ve bu modeli kavrayanlar çok daha bilinçli teknoloji kararları verebilecekler.
Açık Kaynak mı, Açık Peso mu? Bunlar aynı şey değil.

Karışıklığı önlemek için bazı kavramları açıklığa kavuşturalım. Birçok kişi modelleri "açık kaynak" olarak adlandırırken aslında bunlar " ağırlıklı açık " modellerdir. Bu, önceden eğitilmiş parametreleri indirebileceğiniz, ayarlayabileceğiniz ve istediğiniz yerde çalıştırabileceğiniz anlamına gelir, ancak eğitim verilerine veya tüm oluşturma sürecine erişiminiz yoktur. Açık Kaynak Girişimi (OSI) çok daha katıdır: onlara göre, açık yapay zeka, kullanılan eğitim kodunu ve veri setini içermelidir.
Bir avukat için bu fark temeldir, ancak ortalama bir geliştirici, araç çalıştığı ve özelleştirilebilir olduğu sürece pek de önemsemez. Bu, Kubernetes'i (tamamen açık kaynaklı) ikili Linux dağıtımlarıyla karşılaştırmaya benzer; derlenmiş yapıyı alırsınız ve orijinal derleme hattı yaratıcısına ait olsa bile onu değiştirebilirsiniz. Sonuç olarak, topluluk, yapay zekadaki sorumluluk ve etik zorluklar gibi hususları göz önünde bulundurarak, lisansın saflığından ziyade kullanılabilirliğe öncelik verir.
Ekosistem zaten burada ve tam hızla ilerliyor.
Bu ortamın büyüme hızı şaşırtıcı. HuggingFace halihazırda milyonlarca modele ev sahipliği yapıyor ve Llama, Mistral, Qwen ve Gemma gibi aileler etrafında akla gelebilecek her şey geliştiriliyor: mobil cihazlarda veya Apple Silicon'da çalıştırılmak üzere nicelleştirilmiş sürümlerden , hukuk, tıp veya programlamaya özel LoRa adaptörlerine kadar. Dahası, sürekli toplu işleme yoluyla yüksek performanslı çıkarımı yöneten vLLM ve SGLang gibi çalışma ortamları ortaya çıkarken, Ollama tek bir komutla yerel olarak bir modeli başlatmanıza olanak tanıyor.
Bir zamanlar açık kaynak modellerine karşı öne sürülen argüman, GPT-4 veya Claude ile rekabet edemeyecekleriydi. Ancak bu fark neredeyse tamamen kapandı. GLM-5.2 veya Kimi K3 gibi modeller, özellikle karmaşık kod görevlerinde, bazen belirli kıyaslamalarda kapalı kaynak sürümlerini geride bırakarak , en üst düzey performansı sergiliyor . Açık kaynak modelleri "yeterince iyi" olduğunda, Kubernetes'i harekete geçiren ağ etkisi durdurulamaz bir güçle işlemeye başlıyor.
Doğrudan paralellikler: Konteynerlerden yapay zekaya
Yapıyı analiz edersek, benzetme neredeyse birebir aynı. Temel modeller (Llama, Qwen) yapay zekanın Docker'ı gibi davranıyor: Herhangi bir geliştiricinin indirebileceği ve özelleştirebileceği standartlaştırılmış bir başlangıç noktası sağlıyorlar , tıpkı Ubuntu veya Alpine imajlarında yaptığımız gibi. Bu arada, Ollama veya llama.cpp gibi araçlar Docker Compose'un işlevini yerine getirerek, bir modeli yerel geliştirme ortamına entegre etmeyi PostgreSQL konteyneri eklemek kadar basit hale getiriyor.
Bir sonraki adım, Kubernetes'in eşdeğeri olan standartlar katmanıdır. Henüz tanımlanma aşamasında olsa da, parçalarını şimdiden görebiliyoruz: GGUF veya GPTQ formatları OCI imajları gibi davranıyor, OpenAI uyumlu API standart arayüz görevi görüyor ve Hugging Face, modeller için Docker Hub görevi görüyor. Bu hizmet ve dağıtım katmanında ustalaşmayı başaran kişi , sektördeki yeniliklerin çoğunu ele geçirecektir.
Kubernetes'te pratik uygulama
Java ve Spring Boot ile çalışanlar için bu çok önemli bir an. Spring AI ve LangChain4j gibi çerçeveler sayesinde, artık yerel bir model üzerinde geliştirme yapıp, yapılandırma dosyasındaki bir özelliği değiştirerek üretim kümesine geçiş yapmak mümkün. Artık harici API anahtarlarına veya ağımızdan çıkan verilere bağımlı değiliz; bu da veri gizliliğinin son derece önemli olduğu bankacılık ve sağlık hizmetleri gibi sektörler için hayati önem taşıyor.
Teknik açıdan bakıldığında, Kubernetes'te (özellikle GKE'de) dağıtım için iki ana yol vardır. Bir yandan, performansı en üst düzeyde kontrol etmek için vLLM'yi doğrudan çıkarım motoru olarak kullanabiliriz. Diğer yandan, model yönetimi için yerel bir Kubernetes platformu olan KubeAI'yi tercih edebiliriz. KubeAI, bir model kataloğunu yönetmenize olanak tanır ve sıfıra ölçeklendirme gibi özellikler sunar ; bu da istek olmadığında GPU'ları açık tutmayarak işletme maliyetlerini düşürür, ancak bazı soğuk başlatma gecikmelerine neden olur.
Ekonomik ve jeopolitik tartışma
Her şey teknik iyimserlikten ibaret değil; bir soğuk savaş sürüyor. Çin modelleri indirme sayılarında etkileyici bir ilerleme kaydediyor ve bu durum ABD'deki bazı sektörlerin kısıtlamalar getirmeyi düşünmesine yol açıyor. Ancak, ağırlıklar sadece rakamlardan ibaret olduğu ve milliyet etiketi taşımadığı için, bir modeli menşei nedeniyle yasaklamak teknik olarak neredeyse imkansız. Herhangi bir naif yasaklama girişimi kolayca atlatılabilir.
Ayrıca, ekonomik bir gerilim de söz konusu. Bazı uzmanlar, açık ağırlıklandırma modellerinin "yavaşlatıcı" olduğunu savunuyor çünkü bu modeller, öncü laboratuvarların elde edebileceği değeri azaltarak, büyük altyapı yatırımlarını (CAPEX) caydırabilir. 700.000 milyar dolarlık yatırımın kârda tekel garantisi sağlamaması durumunda, sermaye geri çekilebilir. Bununla birlikte, tarih bize açık standardizasyonun genellikle kitlesel benimsemeyi hızlandırdığını ve binlerce girişim için giriş maliyetlerini düşürdüğünü gösteriyor.
Geliştiriciyseniz ve geride kalmak istemiyorsanız, ideal yaklaşım yerel olarak nicelleştirilmiş modellerle denemeler yapmaya başlamaktır. Büyük bir GPU'ya ihtiyacınız yok, çünkü Q4 gibi formatlar 7B'lik bir modelin modern CPU'larda kabul edilebilir şekilde çalışmasına olanak tanır. vLLM, SGLang veya LocalAI kullanmanızdan bağımsız olarak, OpenAI ile uyumlu arayüzler kullanmak çok önemlidir , çünkü bu fiili standarttır. Son olarak, nicelleştirme formatları (örneğin Q4_K_M veya Q8_0) arasındaki farkı anlamak, RAM kullanımını ve uygulamalarınızın yanıt verme hızını optimize etmenizi sağlayacaktır.
Bilgisayar biliminin tarihi bize, kitlesel özelleştirmeyi mümkün kılan açık platformların, kaynaklarından bağımsız olarak, herhangi bir kapalı tedarikçiden nihayetinde daha iyi performans gösterdiğini öğretti. Şu anda yapay zekanın Kubernetes çağını yaşıyoruz; burada kontrollü altyapı üzerinde özel modeller çalıştırma yeteneği, geliştiricilere ve işletmelere teknolojik egemenliği geri kazandırıyor.


