Okuma 9.9 dkKategoriler: LOKAL LLM'LER, AI

Qwen3.8-27B, Alibaba tarafından Ağustos 2026’da yayımlanan 27 milyar parametreli bir dil modelidir. Artificial Analysis Intelligence Index’te 52 puan alarak, kendi sınıfında (40B altı açık ağırlıklı modeller) 1. sıraya yerleşmiştir.

Bu eğitimde, tek bir DGX Spark üzerinde Qwen3.8-27B-NVFP4’ü, SGLang çıkarım motoru ve DFlash2 draft modeli (spekülatif kod çözme) ile çalıştıracak ve saniyede 48 token üretim hızına ulaşacaksınız. SGLang, modelin eğitilmiş ağırlıklarını GPU belleğine yükleyip dışarıdan istek kabul eden bir API sunar. sparkrun ise Docker konteynerini yönetir ve model dosyalarının dağıtımını otomatikleştirir.

Spark, monitör ve klavye bağlayarak doğrudan bilgisayar olarak kullanılabileceği gibi, başka bir bilgisayarla uzaktan bağlanılan bir sunucu olarak da kullanılabilir. Biz bu eğitimde Spark’a uzaktan bağlanacağız ve gerekli yazılımları kurup modeli çalıştıracağız.

Bu eğitim dört bölümden oluşur:

  • Kurulum: Docker imajı indirme ve recipe hazırlama
  • Çalıştırma: Modeli sparkrun ile başlatma, izleme ve test etme
  • Benchmark: Farklı eşzamanlılık seviyelerinde performans ölçüm sonuçları
  • Kapatma: Servislerin durdurulması

Kurulum

1. Spark’a Bağlanma

Spark’a ilk kez uzaktan bağlanıyorsanız IP adresini bulmanız gerekir. Spark’a bir monitör ve klavye bağlayıp giriş yapın ve terminalden şu komutu çalıştırın:

Copy to Clipboard

Komut, Spark’ın varsayılan ağ arayüzünün IP adresini verir:

Copy to Clipboard

Bu adresi not edin; eğitim boyunca yerine bu adresi kullanacaksınız. Alternatif olarak, NVIDIA Sync uygulamasını kontrol ederek de IP adresini bulabilirsiniz.

Bilgisayarınızın Spark’la aynı ağa bağlı olduğundan emin olun. Ardından, bilgisayarınızdan bir terminal açın ve Spark’a SSH ile bağlanın:

Copy to Clipboard

Önceki eğitimlerde sparkrun kurulumu adım adım anlatıldı. Bu eğitimde sparkrun kurulumunun yapılmış olduğunu varsayıyoruz.

2. Docker İmajını İndirme

Qwen3.8-27B’nin hibrit mimarisi ve DFlash2 spekülatif kod çözme özelliği, özel bir SGLang imajı gerektirir. Bu imaj, SGLang’in mainline kod tabanından derlenmiş olup DFlash2 çekirdek yamalarını içerir.

OpenZeka tarafından hazırlanan Docker imajını indirmek için şu komutu çalıştırın:

Copy to Clipboard

İmajı doğrulayın:

Copy to Clipboard
Copy to Clipboard

3. Recipe Hazırlama

Recipe, sparkrun’ın modeli nasıl çalıştıracağını tanımlayan bir YAML dosyasıdır. Model, Docker imajı, SGLang bayrakları ve bellek ayarları tek dosyada toplanır. Qwen3.8-27B için bu recipe, tek Spark üzerinde NVFP4 quantization ile modeli çalıştırır, DFlash2 spekülatif kod çözme (8 taslak token) ile çıkarımı hızlandırır ve Qwen3.8’in hibrit mimarisine özel mamba bellek parametreleri içerir.

Aşağıdaki komutu kullanarak recipe dosyasını kaydedin:

Copy to Clipboard

Dosyayı doğrulayın:

Copy to Clipboard

Kaydettiğiniz recipe dosyasını göreceksiniz.

Çalıştırma

4. Başlatma Öncesi Kontroller

sparkrun’ın recipe’yi doğru ayrıştırdığını ve bellek bütçesinin uygun olduğunu doğrulayın:

Copy to Clipboard
Copy to Clipboard

sparkrun, recipe’yi doğru ayrıştırdı ve ‘DGX Spark fit: YES’ onayını verdi.

5. Modeli Başlatma

Şimdi modeli başlatalım:

Copy to Clipboard

sparkrun otomatik olarak imajı ve modelleri Spark’a senkronize eder (zaten varsa atlar) ve konteyner başlatır.

Copy to Clipboard

sparkrun 6 adımı başarıyla tamamladı. ‘Mode: solo’ görüldü. sparkrun, imajı ve iki modeli (ana model + taslak model) Spark’a senkronize etti.

Model dosyalarının indirilmesi ve SGLang’in servise hazır hale gelmesi birkaç dakika alabilir. Bu süreçte SGLang model ağırlıklarını GPU belleğine yükler, DFlash2 taslak modelini başlatır ve CUDA grafiklerini yakalar.

6. Logları İzleme

SGLang loglarını izlemek için:

Copy to Clipboard

Loglarda şunları göreceksiniz:

Copy to Clipboard

Application startup complete. ve The server is fired up and ready to roll! satırlarını gördüyseniz model sunucusu hazır demektir.

7. Sağlık Kontrolü

Sunucunun çalıştığını doğrulayın:

Copy to Clipboard
Copy to Clipboard

‘HTTP 200’ yanıtı sunucunun sağlıklı olduğunu gösterir.

Qwen3.8-27B şu an çalışıyor ve Spark’ın 8000 portundan servis sağlıyor.

Benchmark

Tek Spark üzerinde çalışan Qwen3.8-27B modelini, farklı eşzamanlılık (concurrency) seviyelerinde test ettik. Ölçümlerde ortalama TTFT (Time to First Token — ilk token’ın üretime başlama süresi) ve TPS (Tokens Per Second — saniye başına üretilen token sayısı) değerleri kaydedilmiştir.

  • Eşzamanlılık 1 — TTFT ort. (ms): 232, TPS ort. (tok/s): 47.9
  • Eşzamanlılık 2 — TTFT ort. (ms): 320, TPS ort. (tok/s): 39.8
  • Eşzamanlılık 4 — TTFT ort. (ms): 343, TPS ort. (tok/s): 35.6
  • Eşzamanlılık 8 — TTFT ort. (ms): 389, TPS ort. (tok/s): 27.6

Model, tek eşzamanlılıkta saniyede ortalama 47.9 token üretiyor. Bununla birlikte, 8 eşzamanlılıkta dahi saniyede 25 token’ın üzerinde ve TTFT’nin 400 ms’nin altında olması, modeli yoğun eşzamanlılıkta kullanım için uygun hale getiriyor.

Ölçümler, CordatusAI LLM Benchmark Tool kullanılarak alınmıştır — 128 token girdi, 128 token çıktı, eşzamanlılık başına 10 round’un ortalaması, geçerlilik koşulu: TTFT < 1000ms AND TPS >= 15 tok/s. Bu araç, CordatusAI tarafından geliştirilen ve OpenAI uyumlu API’lere sahip LLM sunucularını test eden bir benchmarking uygulamasıdır.

Kapatma

İşiniz bittiğinde modeli durdurun:

Copy to Clipboard
Copy to Clipboard

Bu komutla konteyner durdurulur ve bellek alanı boşalır. Ama konteyner, Docker imajı ve model dosyaları diskte kalır. Böylelikle tekrar başlatmak için yeniden indirme yapmanız gerekmez. 5. adımdaki sparkrun run komutunu tekrar çalıştırmanız yeterli.

OPENZEKA HABERLERİ

Abone olmak ister misiniz?

Hemen ilgilendiğiniz alanları seçerek bültenimizden haberdar olabilirsiniz.

Kategoriler

OPENZEKA HABERLERİ

Abone olmak ister misiniz?

Hemen ilgilendiğiniz alanları seçerek bültenimizden haberdar olabilirsiniz.

Kategoriler

Hesaplarınızda paylaşmak ister misiniz?

İlgili Yazılar