Apache Spark ve Spark Connect'teki yeniliklere dair eksiksiz rehber

Son Güncelleme: 16 Ağustos 2026
  • Spark Connect kullanarak, küme yürütmesini yerel ortamdan ayıran bir istemci-sunucu mimarisinin uygulanması.
  • Java 17, 21 ve 25 için güncellenmiş destek ve 4.0.0 sürümünden itibaren Scala 2.13'ün zorunlu kullanımı.
  • Hadoop için önceden paketlenmiş ikili dosyalar, Maven bağımlılıkları veya PyPI üzerinden kurulum yoluyla dağıtım esnekliği.

Mavi ışıkla aydınlatılmış bir veri merkezindeki modern bir sunucu ünitesinin yakın çekim görüntüsü; Apache Spark kümesindeki bir çalışan düğümünü temsil ediyor.

Büyük Veri dünyasında çalışıyorsanız, Apache Spark'ın devasa veri hacimlerini yıldırım hızıyla işleme konusunda neredeyse standart olduğunu bilirsiniz. 4.2 sürümünün gelişiyle birlikte, çerçeve yalnızca performansı optimize etmek için çıtayı yükseltmekle kalmadı, aynı zamanda kümelere bağlanma şeklimizde de niteliksel bir sıçrama yaparak her şeyi çok daha esnek ve daha az zahmetli hale getirdi.

Bu güncellemenin en güçlü yönü şüphesiz ki, tüm çalışma ortamını yerel makinemizde taşımak zorunda kalmamamız için mimariyi nasıl geliştirdikleridir. Artık çok daha olgun bir istemci-sunucu mimarisi sayesinde, bilgisayarımızın çökmesine neden olmadan karmaşık süreçleri her yerden başlatabilir, ağır işleri sunucuya devredebilir ve sonuçları zaten işlenmiş olarak alabiliriz.

modern veri analitiği
İlgili makale:
Modern Veri Analitiği ve Veri Mimarisine Tam Bir Kılavuz

Teknik gereksinimler ve çevre uyumluluğu

Ekranda görüntülenen programlama kodunun yakın çekim görüntüsü, Spark 4.2 için Scala, Python ve Java gibi dillerde geliştirme sürecini göstermektedir.

Spark 4.2'yi çalışır hale getirmek için Java desteğinin çok önemli olduğunu anlamak şarttır. Bu sürüm Java 17, 21 ve 25'e kadar olan sürümlerle uyumludur , ancak 25.0.3'ten önceki Java 25 sürümlerinin artık eski kabul edildiğini unutmayın. Programlama diliyle ilgili olarak, standart artık Scala 2.13'tür ve 2.12 sürümü kesinlikle geride kalmıştır, bu nedenle eski projeleriniz varsa bunları taşımanız gerekecektir.

  Veri Analizi için Python: Mükemmel Araç

Python'ı tercih edenler için 3.10 veya üzeri bir sürüm gereklidir , R ise 4.0 sürümünden itibaren desteklenmektedir, ancak R'nin kullanımının aşamalı olarak azaltıldığını belirtmekte fayda var. İşletim sistemi önemsizdir, çünkü Spark, JAVA_HOME değişkeni veya PATH doğru şekilde yapılandırılmışsa, hem Windows hem de UNIX benzeri sistemlerde ( Cloud Linux veya macOS gibi ) sorunsuz çalışır.

Veri mühendisi için kariyer yolu
İlgili makale:
Veri Mühendisi Olmaya Giden Kariyer Yolu

Kurulum ve dağıtım seçenekleri

Spark tarafından işlenen devasa veri hacimlerinin analizini temsil eden, baloncuk grafikleri ve finansal metriklerle karmaşık veri görselleştirmesi.

Spark'ı indirdiğinizde, altyapınıza bağlı olarak çeşitli seçenekleriniz vardır. En yaygın olanı, Spark'ın HDFS ve YARN'ı yönetmek için istemci kütüphanelerini kullandığı için Hadoop için önceden yapılandırılmış paketleri indirmektir. Bununla birlikte, çok özel bir yapılandırmanız varsa, "Hadoop içermeyen" ikili dosyayı seçebilir ve sınıf yolunu kendiniz yapılandırabilirsiniz.

Geliştiriciyseniz işler daha basit: Java ve Scala kullanıcıları Maven koordinatlarını kullanarak çerçeveyi entegre edebilirken, Python kullanıcıları doğrudan PyPI'den kurabilirler . Çekirdek sistemi değiştirmek isteyen daha maceracı kullanıcılar için ise Spark'ı doğrudan kaynak kodundan derleme seçeneği de mevcuttur.

Apache Kafka-9 nedir
İlgili makale:
Apache Kafka: Nedir, nasıl çalışır ve büyük veriler için neden önemlidir?

Spark Connect devrimi

Veri mühendisi, bir veri merkezindeki sunucu raflarını dizüstü bilgisayar kullanarak izliyor; bu, Spark 4.2 dağıtımını ve küme yönetimini sembolize ediyor.

İşte işler burada ilginçleşiyor. Spark Connect, istemci ve sunucunun birbirinden ayrılamaz olduğu geleneksel modeli kıran bir mimaridir. Artık istemci, mantıksal bir sorgu planı oluşturan ve bunu gRPC ve Arrow aracılığıyla uzak sunucuya gönderen hafif bir katmandır. Bu sunucu, planı analiz etmekten, Catalyst kullanarak optimize etmekten ve kümede yürütmekten sorumludur.

  HTML nedir ve ne için kullanılır?

Bu sistemin en iyi yanı, istemcinin artık tüm Spark altyapısına veya ağır bir yerel JVM'ye sahip olmasına gerek kalmamasıdır. Bu, yerel Python sürümünün küme sürümüyle tam olarak eşleşmesi gerekmeden Spark'ı not defterlerine, IDE'lere, web servislerine veya hatta yapay zeka ajanlarına entegre etmemizi sağlar . Sonuçlar istemciye Arrow grupları halinde döndürülür , bu da veri aktarımını inanılmaz derecede hızlı hale getirir.

İlgili makale:
Apache Flink Nedir: Örnekler ve Kullanım Örnekleriyle Akış ve Toplu Veri İşleme

Uygulama yürütme ve etkileşimli mod

Spark Connect'te yüksek hızlı gRPC ve Apache Arrow iletişimini simgeleyen bir metafor olarak, bir patch panele bağlı fiber optik kablolar.

Denemeye başlamak isteyenler için Spark, dizinde bir dizi örnek içermektedir. examples/src/mainPython uygulamalarını etkileşimli olarak çalıştırmak için şu komutu kullanın: bin/pyspark Bu, en önemli araçtır. Eğer Scala veya Java'yı tercih ediyorsanız, bunu kullanabilirsiniz. bin/run-example <clase>Bu da komut dosyasını dahili olarak başlatır. kıvılcım gönder Uygulamayı başlatmak için.

Ayrıca, çerçeve yapısının iç işleyişini öğrenmek için ideal olan değiştirilmiş bir Scala kabuğu kullanma seçeneği de mevcuttur. Burada önemli bir ayrıntı, bu seçeneğin kullanımıdır. --masterTest yapıyorsanız, en iyisi şunu kullanmaktır. yerel tek bir iplik için veya yerel Dağıtılmış bir ortama geçmeden önce işlemcinizin birden fazla çekirdeğinden yararlanmak.

veri analiz araçları
İlgili makale:
İşletmenizi Devrimleştirecek En İyi 5 Veri Analitiği Aracı

Uyumluluk ve ekosistemde iyileştirmeler

4.2 sürümü "Spark Classic"i unutmadı. Uyumluluk açığını kapatmak ve desteği iyileştirmek için çok çalışma yapıldı. RDD API ve buna izin vermek spark.read.* Giriş olarak DataFrame'leri kabul eder. Ayrıca, hata yayılımı, durum raporlaması ve diğer özellikler optimize edilmiştir. YARN küme modu desteği.

  Swift'e Giriş: Özellikler ve Avantajlar

Dağıtım konusunda, Docker imajlarının ASF dışı yazılımlar içerebileceğini kontrol etmek önemlidir, bu nedenle Dockerfile dosyalarını incelemeniz önerilir. Kararlılık nedenleriyle önceki sürümlere geri dönmeniz gerekiyorsa, yayın dosyaları mevcuttur ; ancak bilinen güvenlik açıklarından kaçınmak için güvenlik sayfasını kontrol etmeniz her zaman önerilir.

Bu yeni sürüm, istemci ve sunucunun birbirinden ayrılması sayesinde büyük veri işlemenin demokratikleşmesini kolaylaştıran, son derece çok yönlü bir araç olarak Spark'ı sağlamlaştırıyor. Java ve Scala için güncellenmiş desteği ve modern geliştirme ortamlarıyla çok daha sorunsuz entegrasyonuyla, verimlilik ve dağıtımda sadelik arayan ölçeklenebilir veri analitiği için mantıklı bir seçim haline geliyor.

Veri analizinin avantajları
İlgili makale:
İşletmeniz için Veri Analizinin 7 Avantajını Keşfedin