Okuma 33.4 dkKategoriler: AI

Bu eğitimde, tek veya birden çok DGX Spark üzerinde bir büyük dil modelini sparkrun kullanarak çalıştıracaksınız.

Spark, monitör ve klavye bağlayarak doğrudan bilgisayar olarak kullanılabileceği gibi, başka bir bilgisayarla uzaktan bağlanılan bir sunucu olarak da kullanılabilir. Biz bu eğitimde Spark’a uzaktan bağlanacağız ve gerekli yazılımları kurup modeli çalıştıracağız.

Dil modeli olarak GPT-OSS 120B (117 milyar parametreli bir Mixture-of-Experts modeli, 5.1 milyar parametre aktif, mxfp4 kuantizasyonu), çıkarım motoru olarak vLLM, ve yönetim aracı olarak sparkrun kullanacağız. vLLM, modelin eğitilmiş ağırlıklarını GPU belleğine yükleyip çalıştıracak ve dışarıdan istek kabul eden bir API sunacak. sparkrun ise komut satırı üzerinden Docker konteynerlerini ve Spark’lar arasında model dağıtımını yönetecek. Bu sayede imaj senkronizasyonu, model aktarımı ve cluster yapılandırması gibi işlemleri otomatik olacak. İkisi de ana Spark üzerinde, Docker konteynerleri içinde çalışacak.

Bu eğitim üç bölümden oluşur:

  • Kurulum: sparkrun kurulumu, Docker imajı derleme, cluster yapılandırması ve recipe oluşturma
  • Tek Sparkla Çalıştırma: Modeli tek Spark üzerinde başlatma, izleme ve test etme
  • İki Sparkla Çalıştırma: Birden çok Spark arasında modeli bölerek (tensor parallelism) çalıştırma ve performans karşılaştırması

    Tek Spark’ınız varsa “Kurulum” ve “Tek Sparkla Çalıştırma” bölümlerini inceleyin. Birden çok Spark kullanıyorsanız “Kurulum” sonrasında doğrudan “İki Sparkla Çalıştırma” bölümüne geçebilirsiniz.

Birden çok Spark kullanıyorsanız, eğitim boyunca ana cihaza Main Spark, diğer cihazlara ise Worker Spark denileceğini unutmayın.

Kurulum

1. Spark’a Bağlanma

Spark’a ilk kez uzaktan bağlanıyorsanız IP adresini bulmanız gerekir. Spark’a bir monitör ve klavye bağlayıp giriş yapın ve terminalden şu komutu çalıştırın:

Copy to Clipboard

Komut, Spark’ın varsayılan ağ arayüzünün IP adresini verir:

Copy to Clipboard

Bu adresi not edin; eğitim boyunca yerine bu adresi kullanacaksınız. Alternatif olarak, NVIDIA Sync uygulamasını kontrol ederek de IP adresini bulabilirsiniz.

Birden çok Spark kullanıyorsanız, diğer her cihaz için de bu adımı tekrarlayın ve adresleri not edin. Eğitim boyunca spark-ip yerine bunları kullanacaksınız.

Birden çok Spark kullanıyorsanız,
tüm Spark’larda aynı kullanıcı adı kullanıldığına emin olmalısınız.
sparkrun, cihazlar arasında parolasız SSH kurarken kullanıcı adlarının eşleşmesine ihtiyaç duyar.
DGX OS varsayılan kullanıcı adı nvidia’dır.
Her Spark’ta kullanıcı adınızı kontrol edin:

whoami

Kullanıcı adı nvidia değilse, tüm Spark’larda bu kullanıcıyı oluşturun;

sudo useradd -m nvidia
sudo usermod -aG
sudo nvidia
sudo passwd nvidia
su – nvidia

Bu komutlar: kullanıcıyı oluşturur, sudo grubuna ekler, parola belirler ve yeni kullanıcıya geçer.
Tüm Spark’larda aynı kullanıcı adı olduğundan emin olun.

Birden çok Spark kullanıyorsanız,
cihazları QSFP kabloları ile birbirine bağlayın.
Kablo, her Spark’taki CX-7 portlarından herhangi birine takılabilir.
Bağlantıyı doğrulamak için her cihaza monitör ve klavyeyle giriş yapıp şu komutu çalıştırın:

ib2netdev

rocep1s0f0 port 1 ==> enp1s0f0np0 (Down)
rocep1s0f1 port 1 ==> enp1s0f1np1 (Up)
roceP2p1s0f0 port 1 ==> enP2p1s0f0np0 (Down)
roceP2p1s0f1 port 1 ==> enP2p1s0f1np1 (Up)

(Up) olarak görünenler kablonun bağlı olduğu portlardır.
(Down) olarak görünenler ise kullanılmayan portlardır.
Herhangi bir arayüz (Up) olarak görünmüyorsa,
QSFP kablosunu kontrol edin ve Spark’ları yeniden başlatın.

Bilgisayarınızın Spark’la aynı ağa bağlı olduğundan emin olun. Ardından, bilgisayarınızdan bir terminal açın ve Spark’a SSH ile bağlanın:

Copy to Clipboard

İlk bağlantıda bir fingerprint uyarısı göreceksiniz. yes yazıp Enter’a basın. Ardından parola sorulduğunda Spark’ın parolasını girin:

Copy to Clipboard

Bağlandığınızda Spark, bu terminalden gönderdiğiniz komutları kabul etmeye başlayacak. Eğitim boyunca karşınıza çıkan tüm komutları bilgisayarınızın bu terminaline gireceksiniz.

2. sparkrun Kurulumu

Öncelikle uv paket yöneticisini indirin:

Copy to Clipboard

uv’yi PATH’e ekleyin:

Copy to Clipboard

PATH güncellendi. ~/.local/bin dizini (uv ve sparkrun’ın yüklü olduğu konum) artık mevcut ve gelecekteki tüm terminal oturumları için PATH’e eklendi. Şimdi sparkrun’ı kurun:

Copy to Clipboard
Copy to Clipboard

Kurulumu doğrulayalım:

Copy to Clipboard
Copy to Clipboard

sparkrun v0.2.40 yüklendi ve erişilebilir durumda.

3. Docker İmajını Derleme

GPT-OSS 120B’den en yüksek performansı almak için, Spark’ın GPU mimarisi için özel olarak derlenmiş CUTLASS MoE ve FlashInfer attention çekirdeklerini içeren bir Docker imajı derleyeceğiz. Bu imaj, aynı zamanda –mxfp4-backend, –mxfp4-layers bayraklarını ve GPT-OSS’in tiktoken kodlama dosyalarını içerir.

Bu imajı eugr topluluk projesinin build-and-copy.sh komut dosyası ile derleyeceğiz. Önce eugr reposunu klonlayın:

Copy to Clipboard

Repodaki Dockerfile.mxfp4 dosyası, build-and-copy.sh’ın derleyeceği kaynak kodun sürümünü belirler. Derlemeye başlamadan önce bu sürümün güncel olduğuna emin olmalıyız. Bu sebeple, christopherowen topluluk projesinin vLLM fork’undaki mxfp4_v2 dalının en güncel commit hash’ini sorgulayalım:

Copy to Clipboard

Komutun döndürdüğü bu hash, build-and-copy.sh’ı istediğimiz vLLM kaynak kodlarının en güncel sürümüne yönlendirecek. Bunu kopyalayın ya da not edin. Ardından Dockerfile.mxfp4 dosyasını nano ile açın:

Copy to Clipboard

Dosya açıldığında, dosyada arama yapmak için Ctrl+W tuşlarına basın, VLLM_SHA yazıp Enter’a basın. İmleç şuna benzer bir satıra konumlanacak:

Copy to Clipboard

Eski hash değerini silin ve yukarıda not ettiğiniz güncel hash’i yapıştırın. Ardından dosyayı kaydetmek için Ctrl+O’ya basın, Enter ile onaylayın, ardından Ctrl+X ile nano’dan çıkın.

Dockerfile.mxfp4 dosyasında yaptığımız değişikliği doğrulayalım:

Copy to Clipboard

Dönen hash değeri, önceki adımda kopyaladığınız güncel hash değeri olmalı.

Fallback:
Eğer en güncel commit ile sorun yaşarsanız, test edip onayladığımız 04f641e537e80a67db464c6e65b928dbfab5d647 (28 Ocak 2026) hash’ini kullanabilirsiniz.
Ayrıca dilerseniz, daha güncel commit’leri commit geçmişinden kontrol edebilirsiniz.

Şimdi imajı derleyin:

Copy to Clipboard

İlk derleme yaklaşık 50 dakika sürer; daha sonraki derlemeler önbellek sayesinde yaklaşık 5 dakikada tamamlanır. Derleme tamamlandığında şu çıktıyı göreceksiniz:

Copy to Clipboard

İmajı doğrulayın:

Copy to Clipboard

İmajın vLLM sürümünü doğrulayın:

Copy to Clipboard

Birden çok Spark kullanıyorsanız, imajı yalnızca Main Spark’a derlemiş olmanız yeterlidir. sparkrun, ilk başlatmada imajı CX-7 ağı üzerinden Worker’lara otomatik senkronize edecektir. Ek bir adıma gerek yok.

4. Kurulum Sihirbazı

sparkrun kurulum sihirbazı, Spark’ı çalıştırmak için gerekli tüm altyapıyı tek bir interaktif komutla yapılandırır:

Copy to Clipboard

Altı faz sırayla çalışır, fazlar interaktiftir. İlk fazda ‘Enter host IPs/hostnames’ kısmına yi girip Enter’a basın. Devamındaki sorularda doğrudan Enter’a basarak (varsayılan seçenekleri onaylayarak) devam edebilirsiniz:

Birden çok Spark kullanıyorsanız, ‘Enter host IPs/hostnames’ kısmına tüm Spark’ların IP adreslerini virgülle ayırarak girin (örneğin main-spark-ip,worker-spark-ip1 ,worker-spark-ip2 ).

Copy to Clipboard

İkinci faz, parolasız SSH bağlantısını kurar. Y yazıp Enter’a basın:

Birden çok Spark kullanıyorsanız, sihirbaz bu fazda Worker Spark’lara SSH ile bağlanır ve parola sorar. Parolayı girin — bu adım bir kez yapılır, sihirbaz parolasız SSH anahtarlarını dağıttıktan sonra sonraki tüm bağlantılarda parola sorulmaz.

Copy to Clipboard

Üçüncü faz, CX-7 yüksek hızlı ağ arayüzlerini yapılandırır. Tek Spark kullanılıyorsa otomatik olarak atlanır. Y yazıp Enter’a basın:

Birden çok Spark kullanıyorsanız, sihirbaz CX-7 arayüzlerini otomatik olarak algılar, çakışmayan alt ağlar seçer, her Spark’a statik IP atar, MTU 9000 (jumbo frame) ayarlar ve /etc/netplan/40-cx7.yaml dosyasını yazıp netplan apply ile uygular. Bu işlem root yetkisi gerektirir — sudo parolasını girin.

Copy to Clipboard

CX-7 yapılandırması sonrası sihirbaz, SSH ağını yeni IP’lerle otomatik yeniler. Bu faz ek bir girdi gerekmez.

Copy to Clipboard

Dördüncü faz, kullanıcının docker grubunda olduğunu doğrular. Y yazıp Enter’a basın:

Copy to Clipboard

Beşinci faz, kısıtlı sudoers kuralları yükler. Yüklenen kurallar HuggingFace önbellek sahipliğini parolasız düzeltme ve Linux sayfa önbelleğini parolasız temizleme içindir. Geniş sudo yetkisi verilmez. Y yazıp Enter’a basın:

Copy to Clipboard

Altıncı faz, earlyoom OOM korumasını kurar. earlyoom, DGX Spark’ın birleşik bellek mimarisinde bellek sınırına yaklaşıldığında sistemi kilitlemek yerine çıkarım süreçlerini sonlandırır. Y yazıp Enter’a basın:

Copy to Clipboard

5. Recipe Oluşturma

Recipe, sparkrun’ın modeli nasıl çalıştıracağını tanımlayan bir YAML dosyasıdır. Model, Docker imajı, vLLM bayrakları ve bellek ayarları tek dosyada toplanır. Bu recipe hem tek Spark (TP=1) hem de birden çok Spark (TP>1) için kullanılabilir — tek fark, başlatma komutunda –tp değerinin Spark sayısına göre değiştirilmesidir.

Copy to Clipboard

Dosyayı doğrulayın:

Copy to Clipboard
Copy to Clipboard

Recipe’deki önemli alanlar ve seçilme nedenleri:

  • container: vllm-node-mxfp4 — 3. adımda derlenen imaj; CUTLASS/FlashInfer fork’larını içerir.
  • tensor_parallel: 1 (varsayılan) — Tek Spark varsayılanı; birden çok Spark için --tp değeri ile geçersiz kılınır.
  • gpu_memory_utilization: 0.7 — DGX Spark UMA için güvenli değer.
  • --distributed-executor-backend ray: Ray — sparkrun Ray’i otomatik algılar ve Ray kümesini kurar. TP=1 için tek düğümlü Ray çalışır.
  • --mxfp4-backend CUTLASS: CUTLASS — Özel CUTLASS MXFP4 MoE GEMM çekirdeği.
  • --mxfp4-layers moe,qkv,o,lm_head: Tam — Tüm katmanlar FP4’e kuantize edilir.
  • --attention-backend FLASHINFER: FlashInfer — GPT-OSS’un attention yapısını destekleyen özel FlashInfer çekirdeği.
  • --kv-cache-dtype fp8: FP8 — KV cache için azaltılmış bellek.
  • --load-format fastsafetensors: Hızlı yükleyici — Yaklaşık 41 sn model yükleme.
  • --reasoning-parser openai_gptoss: Harmony — Düşünce sürecini reasoning alanına ayırır.
  • --tool-call-parser openai: Araç kullanımı — --enable-auto-tool-choice için gereklidir.

Önemli: –rootful bayrağı recipe’de değil, başlatma komutunda verilir. FlashInfer, çalışma zamanında CUTLASS attention çekirdeklerini derler ve bu derleme için root yetkisine ihtiyaç duyar. Başlatma komutları ilgili bölümün “Modeli Başlatma” adımında gösterilmiştir.

6. Başlatma Öncesi Kontroller

sparkrun’ın recipe’yi doğru ayrıştırdığını ve bellek bütçesinin uygun olduğunu doğrulayın:

Copy to Clipboard
Copy to Clipboard

sparkrun, recipe’yi doğru ayrıştırdı, vllm-ray’i seçti ve ‘DGX Spark fit: YES’ onayını verdi.

Şimdi başlatma planını önizleyin:

Copy to Clipboard
Copy to Clipboard

Dry run başarılı. Recipe geçerli, serve command eklediğimiz flagleri içeriyor ve başlatılmaya hazır. Model Spark’ta kurulu değilse, sparkrun ilk başlatmada modeli Hugging Face’ten otomatik indirecektir. GPT-OSS 120B modeli yaklaşık 183 GB’tır; indirme süresi internet hızınıza bağlıdır. Dry run bu indirmeyi tetiklemez, indirme yalnızca gerçek başlatmada olur.

Birden çok Spark kullanıyorsanız, TP dry-run için –tp değerini Spark sayısına göre belirleyin (örneğin iki Spark için –tp 2). Serve command içinde –tensor-parallel-size 2 göreceksiniz ve mode solo yerine cluster (2 nodes) olarak görünecek:

Copy to Clipboard

Tek Sparkla Çalıştırma

1. Önbelleği Temizleme

vLLM’i başlatmadan önce dosya sistemi önbelleğini boşaltın:

Copy to Clipboard

Bunu yapmamızın temel sebebi DGX Spark’ın birleşik bellek mimarisidir: İşletim sistemi, diskten okuduğu model dosyalarını RAM’de önbelleğe alır. vLLM, buradaki model ağırlıklarını GPU belleğine yükler. Yükleme bittikten sonra önbellekte kalan veri bir daha kullanılmayacak olsa da hemen temizlenmez. Ayrı bellek kullanan sistemlerde bu önemli değildir. Çıkarım GPU belleğinde çalıştığından RAM’in doluluğu performansı etkilemez. Spark’ta ise CPU ve GPU aynı RAM’i paylaştığından, önbellek GPU’nun kullanabileceği alanı daraltır. Komut, bu önbelleği boşaltarak vLLM için maksimum bellek sağlar.

Parola sorulduğunda Spark’ın parolasını girin. Komut çıktı vermez, sessizce tamamlanır:

Copy to Clipboard

2. Modeli Başlatma

Şimdi modeli başlatalım:

Copy to Clipboard

–rootful bayrağı, konteyneri root yetkisiyle çalıştırır. FlashInfer, çalışma zamanında CUTLASS attention çekirdeklerini derler ve bu derleme için root yetkisine ihtiyaç duyar. –no-follow bayrağı ise sparkrun’ın konteynerleri başlattıktan sonra komut satırına dönmesini sağlar.

Copy to Clipboard

sparkrun 6 adımı da başarıyla tamamladı. İmaj derleme atlandı ve kurulum kısmında derlediğimiz imaj kullanıldı. Model dosyaları zaten diskte olduğu için dağıtım hızlıca tamamlandı. Serve command içinde tüm bayraklar doğru çözüldü.

3. Başlangıç Sürecini İzleme

Model indirme tamamlandıktan sonra vLLM’in servise hazır hale gelmesi birkaç dakika alabilir. Bu süreçte vLLM model ağırlıklarını GPU belleğine yükler, GPU çekirdeklerini derler ve çıkarım için bellek ayırır.

vLLM loglarını izlemek için:

Copy to Clipboard

Loglarda şunları göreceksiniz:

Copy to Clipboard

Application startup complete. satırını gördüyseniz model sunucusu hazır demektir. Ctrl+C tuşlarına basarak log izlemeyi durdurun. Sunucu arka planda çalışmaya devam edecektir.

4. Modeli Test Etme

Öncelikle sunucunun çalıştığını doğrulayın:

Copy to Clipboard

‘HTTP 200’ yanıtı sunucunun sağlıklı olduğunu gösterir. Şimdi sparkrun konteyner durumunu kontrol edin:

Copy to Clipboard
Copy to Clipboard

Kayıtlı modelleri listeleyin:

Copy to Clipboard
Copy to Clipboard

Model openai/gpt-oss-120b kayıtlı.

Şimdi modeli “What is 12*17?” promptuyla test edin:

Copy to Clipboard

Yanıtın basitleştirilmiş hali aşağıdaki gibidir. content alanında (modelin verdiği yanıt) 204 ifadesini göreceksiniz. Buradan, modelin çarpma işlemini doğru yaptığını anlayabilirsiniz. Ayrıca yanıtın bir de reasoning alanı var. Bu alan, modelin düşünce sürecini içerir. GPT-OSS’un Harmony formatı çalışıyor: düşünce süreci ve son yanıt ayrı alanlarda sunulur:

Copy to Clipboard

vLLM şu an çalışıyor ve Spark’ın 8000 portunda servis sağlıyor. GPT-OSS 120B’ye soru sorup cevap alabiliyoruz.

5. Kapatma

İşiniz bittiğinde modeli durdurun:

Copy to Clipboard

Bu komutla konteyner durdurulur ve bellek alanı boşalır. Ama konteyner, Docker imajı ve model dosyaları diskte kalır. Böylelikle tekrar başlatmak için yeniden indirme yapmanız gerekmez. 2. adımdaki sparkrun run komutunu tekrar çalıştırmanız yeterli.

İki Sparkla Çalıştırma

1. Önbelleği Temizleme

vLLM’i başlatmadan önce her iki Spark’ta da dosya sistemi önbelleğini boşaltın. Bunu yapmamızın temel sebebi DGX Spark’ın birleşik bellek mimarisi (UMA) olmasıdır: İşletim sistemi, diskten okuduğu model dosyalarını RAM’de önbelleğe alır. vLLM, buradaki model ağırlıklarını GPU belleğine yükler. Yükleme bittikten sonra önbellekte kalan veri bir daha kullanılmayacak olsa da hemen temizlenmez. Ayrı bellek kullanan sistemlerde bu önemli değildir. Çıkarım GPU belleğinde çalıştığından RAM’in doluluğu performansı etkilemez. Spark’ta ise CPU ve GPU aynı RAM’i paylaştığından, önbellek GPU’nun kullanabileceği alanı daraltır. Komut, bu önbelleği boşaltarak vLLM için maksimum bellek sağlar.

Main Spark’ta önbelleği temizleyin:

Copy to Clipboard

Main Spark’tan SSH ile Worker Spark’ta da aynı temizliği uygulayın:

Copy to Clipboard

2. Modeli Başlatma

Şimdi, modeli iki Spark üzerinde başlatalım:

–tp 2 bayrağı, sparkrun’a modeli iki Spark arasında bölerek (tensor parallel) çalıştırmasını söyler. –rootful bayrağı, konteyneri root yetkisiyle çalıştırır — FlashInfer, çalışma zamanında CUTLASS attention çekirdeklerini derler ve bu derleme için root yetkisine ihtiyaç duyar. –no-follow bayrağı ise sparkrun’ın konteynerleri başlattıktan sonra komut satırına dönmesini sağlar. sparkrun otomatik olarak imajı Worker’a senkronize eder (aynı ID ise atlar), modeli Worker’a kopyalar (zaten varsa atlar), Ray kümesini kurar, NCCL yapılandırmasını CX-7 arayüzleri için ayarlar ve her iki Spark’ta konteyner başlatır.

Copy to Clipboard
Copy to Clipboard

sparkrun 6 adımı başarıyla tamamladı. ‘Mode: cluster (2 nodes)’ kısmı görüldü. İmaj Worker’a CX-7 üzerinden senkronize edildi. Serve command içinde –tensor-parallel-size 2 görünüyor. sparkrun, –distributed-executor-backend ray komutunu algılayarak vllm-ray çalışma zamanını seçti ve Ray kümesini otomatik kurdu.

TP=2’de model ağırlıkları ikiye bölünür — her Spark ~30 GB yükler (TP=1’de 61 GB’di). Bu sayede her Spark’ta KV cache için 35.97 GiB bellek kalır (TP=1’de 8.46 GiB’di) — bu, daha fazla eşzamanlı istek anlamına gelir.

3. Başlangıç Sürecini İzleme

Model indirme tamamlandıktan sonra vLLM’in servise hazır hale gelmesi birkaç dakika alabilir. Bu süreçte vLLM model ağırlıklarını GPU belleğine yükler, GPU çekirdeklerini derler ve çıkarım için bellek ayırır.

Loglarını izleyin:

Copy to Clipboard

Loglarda şunları göreceksiniz:

Copy to Clipboard

Application startup complete. satırını gördüyseniz model sunucusu hazır demektir. Ctrl+C tuşlarına basarak log izlemeyi durdurun. Sunucu arka planda çalışmaya devam edecektir.

4. Modeli Test Etme

Konteyner durumunu kontrol edin. Her iki Spark’ta da konteyner çalışıyor olmalı:

Copy to Clipboard
Copy to Clipboard

İki konteyner de çalışıyor.

Modele sağlık kontrolü yapalım:

Copy to Clipboard

Model sağlıklıysa şimdi modeli bir promptla test edelim:

Copy to Clipboard
Copy to Clipboard

Model 12 × 17 = 204 cevabını verdi. Ayrıca reasoning ve reasoning_content alanlarında modelin düşünce süreçleri yer alıyor.

API, yalnızca head node (Main Spark) üzerinden servis edilir. Yani modelle Main Spark üzerinden iletişim kurarız. Worker Spark sadece çıkarım hesaplamasına katılır.

5. Kapatma

İşiniz bittiğinde modeli durdurun. Başlatırken –tp 2 kullandığınız için, durdururken de –tp 2 belirtmeniz gerekir:

Copy to Clipboard

Bu komutla konteyner durdurulur ve bellek alanı boşalır. Ama konteyner, Docker imajı ve model dosyaları diskte kalır. Böylelikle tekrar başlatmak için yeniden indirme yapmanız gerekmez. 2. adımdaki sparkrun run komutunu tekrar çalıştırmanız yeterli.

Open WebUI ile Kullanım

Önceki eğitimde (DGX Spark Üzerinde vLLM ile Yerel LLM Sunumu) Open WebUI’yi kurmuş ve vLLM’in 8000 portuna bağlamıştık. GPT-OSS 120B modeli de aynı 8000 portundan sunulur. Open WebUI çalışıyorsa, modeli otomatik olarak algılar ve sohbet ekranındaki model seçim menüsünde openai/gpt-oss-120b olarak listeler. Dilerseniz modeli seçip ve tarayıcıdan kullanmaya başlayabilirsiniz.

Tek vs İkili Spark Performans Karşılaştırması

Tek Spark (TP=1) ve iki Spark (TP=2) konfigürasyonlarını farklı
eşzamanlılık (concurrency) seviyelerinde karşılaştırdık.
Ölçümlerde ortalama TTFT (Time to First Token — ilk token’ın üretime başlama süresi)
ve TPS (Tokens Per Second — saniye başına üretilen token sayısı) değerleri kaydedilmiştir.

Eşzamanlılık Tek Spark TTFT (ms) İki Spark TTFT (ms) Tek Spark TPS (tok/s) İki Spark TPS (tok/s) TPS Gelişimi
1 219.57 167.69 55.65 69.86 +26%
2 294.41 227.76 37.05 51.52 +39%
4 320.61 255.41 25.20 37.14 +47%
8 395.31 291.94 16.88 26.92 +59%
16 444.10 319.99 11.67 19.08 +63%

İki Spark’lı yapı, eşzamanlılık 1 seviyesinde (tek kullanıcı) %26 daha yüksek token üretim hızı
sağlarken, eşzamanlılık arttıkça bu fark büyür ve eşzamanlılık 16 için görüldüğü üzere
%60’ın üzerine çıkar.

Ölçümler, CordatusAI LLM Benchmark Tool kullanılarak alınmıştır. Bu araç, CordatusAI tarafından geliştirilen ve OpenAI uyumlu API’lere sahip LLM sunucularını test eden bir benchmarking uygulamasıdır.

Uygulamanın modelimiz için ürettiği benchmark sonuçlarının ekran görüntüleri aşağıdaki gibidir.
Görüldüğü üzere uygulama, 1’den 64’e kadar eşzamanlılık seviyelerinde test yapabilir ve her seviyede TTFT, ITL, TPS, gecikme ve throughput metriklerini ölçüp sonuçları tablo ve grafikler olarak sunar.

Ayrıca sistemin destekleyebileceği önerilen kullanıcı sayısını hesaplar. Bu hesaplama, belirli varsayımlara dayanan genel bir tahmindir ve tüm kullanım senaryolarını yansıtmaz. Görselde görüldüğü üzere araç, tek Spark için 55, iki Spark için ise 120 önerilen kullanıcı sayısı hesaplamıştır.

Tek Spark benchmark sonuçları:

İki Spark benchmark sonuçları:

OPENZEKA HABERLERİ

Abone olmak ister misiniz?

Hemen ilgilendiğiniz alanları seçerek bültenimizden haberdar olabilirsiniz.

Kategoriler

OPENZEKA HABERLERİ

Abone olmak ister misiniz?

Hemen ilgilendiğiniz alanları seçerek bültenimizden haberdar olabilirsiniz.

Kategoriler

Hesaplarınızda paylaşmak ister misiniz?

İlgili Yazılar