Bu eğitimde, iki DGX Spark üzerinde DeepSeek-V4-Flash-0731 büyük dil modelini sparkrun kullanarak çalıştıracaksınız. Bu model, 284 milyar toplam ve 13 milyar aktif parametre ile çalışan bir Mixture-of-Experts modelidir. Ayrıca, çalıştırmadan önce modelin ne kadar zeki olduğunu inceleyeceğiz.
Spark, monitör ve klavye bağlayarak doğrudan bilgisayar olarak kullanılabileceği gibi, başka bir bilgisayarla uzaktan bağlanılan bir sunucu olarak da kullanılabilir. Biz bu eğitimde Spark’a uzaktan bağlanacağız ve gerekli yazılımları kurup modeli çalıştıracağız.
Çıkarım motoru olarak vLLM ve yönetim aracı olarak sparkrun kullanacağız. vLLM, modelin eğitilmiş ağırlıklarını GPU belleğine yükleyip çalıştıracak ve dışarıdan istek kabul eden bir API sunacak. sparkrun ise komut satırı üzerinden Docker konteynerlerini ve Spark’lar arasında model dağıtımını yönetecek. Bu sayede imaj senkronizasyonu, model aktarımı ve cluster yapılandırması gibi işlemler otomatik olacak. İkisi de ana Spark üzerinde, Docker konteynerleri içinde çalışacak.
Bu eğitim altı bölümden oluşur:
- Modelin Zekası: Yapay zeka modellerinin zekasını ölçen testler, bunların performans testlerinden farkı ve DeepSeek-V4-Flash-0731’in öncü modeller içindeki konumu
- Kurulum: Docker imajı indirme ve recipe hazırlama
- Çalıştırma: Modeli iki DGX Spark üzerinde sparkrun ile başlatma, izleme ve test etme
- Benchmark: Farklı eşzamanlılık seviyelerinde performans ölçüm sonuçları
- OpenCode ile Kullanma: Modeli yerel bir kodlama asistanına bağlama
- Kapatma: Servislerin durdurulması
Eğitim boyunca ana cihaza Main Spark, ikincil cihaza ise Worker Spark denileceğini unutmayın.
1. Performans Testleri vs Zeka Testleri
“AI Benchmark” denildiğinde genelde akla model performans testleri gelir. Biz de önceki eğitimlerde ağırlıklı olarak bu testlere odaklandık: Zeki olduğunu bildiğimiz çeşitli modelleri Spark üzerinde çalıştırdık. Sonrasında modelin saniyede kaç token üretebildiği (TPS), ilk tokenin ne kadar sürede geldiği (TTFT) veya farklı eşzamanlılık seviyelerindeki token üretimi (throughput) gibi değerleri test ettik.
Performans testleri, temel olarak modelin ne kadar hızlı yanıt verdiğiyle ilgilidir. Belirli bir modelin hangi donanım ve yazılımla çalıştırıldığına bağlıdır. Ancak modelin yanıtlarının doğru olup olmadığı konusunda bize bilgi vermez. Yani bir model 70 tok/s hızında çalışabilir ama yanlış veya anlamsız yanıtlar üretebilir.
Zeka testleri ise temelde modelin yanıtlarının doğruluğu ile ilgilidir. Donanımdan bağımsızdır — modelin eğitilmiş ağırlıklarıyla ilgili bir özelliktir.
2. Artificial Analysis ve Zeka Endeksleri
Artificial Analysis , yapay zeka modellerini bağımsız olarak değerlendiren bir platformdur. Hiçbir model üreticisine bağlı değildir ve yüzlerce modeli aynı koşullar altında test eder.
Sonuçlar tamamen şeffaftır — test yöntemleri, soru şablonları ve puanlama kuralları herkese açıktır. Yayınladıkları indeksler, akademik ve endüstriyel araştırma topluluğu tarafından yaygın kullanılan ve güvenilen testleri bir araya getirir.
Bu testler OpenAI, NYU, Stanford ve Center for AI Safety gibi çeşitli bağımsız kaynaklardan gelir.
| Endeks | Neleri Ölçer | Dahil Testler |
|---|---|---|
| Intelligence Index | Genel zeka (tüm yeteneklerin bileşimi) | GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity’s Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR |
| Coding Index | Kodlama yeteneği | Terminal-Bench v2.1, SciCode |
| Agentic Index | Ajan yeteneği (araç kullanma, planlama) | GDPval-AA v2, τ³-Banking |
Artificial Analysis’ın modellerin zekasını değerlendirmek için kullandığı ana metrik Intelligence Index’tir. Bu indeks, 9 ayrı zeka testinin sonuçlarını belirli ağırlıklarla birleştirir. Coding Index ve Agentic Index ise Intelligence Index’te yer alan testler arasından sırasıyla kodlama ve ajan yeteneklerini ölçen testleri kullanır.
Bu testler şunlardır:
GDPval-AA v2 — 44 meslekten gerçek dünya görevleri. En yüksek ağırlıklı bileşendir (%20).
τ³-Banking — 97 bankacılık senaryosunda çok adımlı ajan görevleri (%14 ağırlık).
Terminal-Bench v2.1 — Terminal ortamında 89 mühendislik görevi (%16 ağırlık).
SciCode — 16 bilim alanında 288 kodlama problemi (%8 ağırlık).
Humanity’s Last Exam — 500’den fazla kurumdan uzmanlarca hazırlanan 2500 matematik, fen ve sosyal bilimler sorusu (%12 ağırlık).
GPQA Diamond — PhD seviyesinde 198 bilim sorusu (%6 ağırlık).
CritPt — 71 araştırma seviyesinde fizik problemi (%6 ağırlık).
AA-Omniscience — 6000 açık uçlu bilgi sorusu (%12 ağırlık).
AA-LCR — Çeşitli uzunluklardaki belgelerden bilgi çıkarımı ve akıl yürütme (%6 ağırlık).
Kaynak: Artificial Analysis Intelligence Benchmarking Metodolojisi
3. Intelligence Index (Genel Zeka İndeksi)
DeepSeek-V4-Flash-0731, Artificial Analysis Intelligence Index’te 50 puan almıştır. Bu skor, açık ağırlıklı modeller arasında 3. sıradadır.

| Sıra | Model | Intelligence Index | Toplam Param. | Aktif Param. |
|---|---|---|---|---|
| 1 | Kimi K3 (max) | 57 | 2800B | 104B |
| 2 | GLM-5.2 (max) | 51 | 744B | 40B |
| 3 | DeepSeek-V4-Flash-0731 (max) | 50 | 284B | 13B |
| 4 | MiniMax-M3 | 44 | 428B | 23B |
| 5 | MiMo-V2.5-Pro | 42 | 1020B | 42B |
| 6 | Inkling | 41 | 975B | 41B |
| 7 | Nemotron 3 Ultra | 38 | 550B | 55B |
| 8 | Mistral Medium 3.5 | 30 | 128B | 128B |
| 9 | Gemma 4 31B | 29 | 30.7B | 30.7B |
| 10 | gpt-oss-120b (high) | 24 | 117B | 5.1B |
| 11 | Command A+ | 23 | 218B | 25B |
DeepSeek-V4-Flash-0731’in bu sıralamadaki konumunu, modellerin parametre sayılarıyla birlikte incelediğimizde istisnai bir tablo ortaya çıkıyor. Kendisinden önceki iki model çok daha büyük yapılara sahip: Kimi K3, 2.8 trilyon parametreyle Flash’ın yaklaşık 10 katı büyüklükte; 104 milyar aktif parametreyle her token için 8 kat daha fazla hesaplama yapıyor. GLM-5.2 ise 744 milyar toplam ve 40 milyar aktif parametreyle Flash’ın yaklaşık 2.6 katı büyüklükte. Buna rağmen Flash, genel zeka indeksinde GLM-5.2’nin sadece 1 puan gerisinde kalıyor.
Daha da çarpıcı bir tablo ise, sıralamada Flash’ın altında kalan modeller incelendiğinde ortaya çıkıyor. İlk 9 model — yani Intelligence Index’i 29 ve üzeri olanlar — arasında Flash, en az aktif parametreye sahip modeldir. Sıralamadaki diğer tüm MoE modelleri hem daha fazla toplam hem de daha fazla aktif parametre kullanıyor. Flash’tan daha az aktif parametreye sahip ilk modele ulaşmak için 10. sıradaki gpt-oss-120b’e kadar inmek gerekiyor. Orada da modelin zeka indeksinin 24 olduğunu görüyoruz — yani Flash’ın yarısından az.
Bu tablonun yerel çıkarım için doğrudan bir anlamı vardır: Parametre sayısı, model büyüklüğünün ölçütüdür. Büyüklük ise, modeli çalıştırmak için gereken bellek ve işlem kapasitesiyle doğrudan ilişkilidir. Intelligence Index 50 seviyesinde bir zeka performansına ulaşmak için listedeki başka bir modeli seçtiğinizde, modeli çalıştırmak için daha büyük bir donanıma ihtiyaç duyarsınız.
Örneğin, önceki eğitimlerimizde GLM-5.2’yi çalıştırmak için 4 DGX Spark kullanmıştık. Kimi K3’ün 2.8 trilyon parametresi ise çok daha büyük donanımlar gerektirecektir. DeepSeek-V4-Flash-0731 ise sadece 284 milyar toplam ve 13 milyar aktif parametreyle, iki DGX Spark üzerinde çalışabilen bu zeka seviyesindeki tek modeldir.
4. Coding Index (Kodlama İndeksi)
Coding Index, Terminal-Bench v2.1 ve SciCode testlerinin ağırlıklı ortalamasıdır. Bu testler, modelin kodlama problemlerindeki performansını ve ajan becerisini ölçer. DeepSeek-V4-Flash-0731, açık ağırlıklı modeller arasında kodlama alanında 2. sırada yer alır.

| Sıra | Model | Coding Index |
|---|---|---|
| 1 | Kimi K3 (max) | 76.2 |
| 2 | DeepSeek-V4-Flash-0731 (max) | 69.1 |
| 3 | GLM-5.2 (max) | 68.8 |
| 4 | MiMo-V2.5-Pro | 60.2 |
| 5 | MiniMax-M3 | 58.6 |
| 6 | Inkling | 52.1 |
| 7 | Nemotron 3 Ultra | 49.3 |
| 8 | Mistral Medium 3.5 | 46.9 |
| 9 | Gemma 4 31B | 43.4 |
| 10 | gpt-oss-120b (high) | 30.4 |
| 11 | Command A+ | 27.8 |
DeepSeek-V4-Flash-0731, kodlama indeksinde 69.1 puan alır. Onu izleyen GLM-5.2 ise 68.8 puanda kalır — yani Flash, 2.6 katı büyüklüğündeki GLM-5.2’yi bile geçerek ikinci sıraya yerleşmiştir.
5. Agentic Index (Ajan İndeksi)
Agentic Index, GDPval-AA v2 ve τ³-Banking testlerinin ağırlıklı ortalamasıdır. Modelin ajan yeteneğini ölçer. Ajan yeteneği, modelin bir otonom ajan olarak — web araştırması yapma, terminal komutları çalıştırma, kod yazma — ne kadar iyi çalıştığını gösterir. Coding Index’te gördüğümüz tabloya benzer şekilde, DeepSeek-V4-Flash-0731, bu alanda da açık ağırlıklı modeller arasında, 45.7 puanla 2. sırada yer alır.

| Sıra | Model | Agentic Index |
|---|---|---|
| 1 | Kimi K3 (max) | 50.1 |
| 2 | DeepSeek-V4-Flash-0731 (max) | 45.7 |
| 3 | GLM-5.2 (max) | 43.1 |
| 4 | MiniMax-M3 | 35.4 |
| 5 | Inkling | 32.3 |
| 6 | MiMo-V2.5-Pro | 29.1 |
| 7 | Nemotron 3 Ultra | 27.4 |
| 8 | Mistral Medium 3.5 | 19.0 |
| 9 | Gemma 4 31B | 14.4 |
| 10 | gpt-oss-120b (high) | 13.2 |
| 11 | Command A+ | 9.2 |
Kurulum
Ön Hazırlık
Önceki eğitimlerde Spark’a bağlanma, sparkrun kurulumu ve çoklu Spark küme yapılandırma süreçleri adım adım anlatıldı. Bu eğitimde tüm bu adımların yapılmış ve kurulumunuzun hazır olduğunu varsayıyoruz.
Bu eğitim 2 DGX Spark gerektirir. Ana cihaza <main-spark-ip>, diğer cihaza ise <worker-spark-ip> diyeceğiz. Her cihazın IP adresini önceden not edin.
1. Docker İmajını İndirme
DeepSeek-V4-Flash-0731’in MoE mimarisi ve MLA (Multi-Head Latent Attention) yapısı, GB10 (SM 12.1) için derlenmiş çekirdeklere ihtiyaç duyar. Standart vLLM imajları bu çekirdekleri içermez. Bu yüzden, gereken B12X çekirdeklerini içeren özel bir Docker imajı kullanacağız.
OpenZeka tarafından hazırlanmış Docker imajını indirmek için şu komutu çalıştırın:
İmajı doğrulayın:
2. Recipe Hazırlama
Recipe, sparkrun’ın modeli nasıl çalıştıracağını tanımlayan bir YAML dosyasıdır. Model, Docker imajı, vLLM bayrakları ve bellek ayarları tek dosyada toplanır. DeepSeek-V4-Flash-0731 için bu recipe, 2 düğümde tensor parallelism (iki Spark, model ağırlık matrislerini bölüştürür) kullanır, modeli maksimum bağlam penceresiyle çalıştırır ve DSpark speculative decoding (k=5) ile model çıkarımını hızlandırır.
Aşağıdaki komutu kullanarak recipe dosyasını kaydedin.
Dosyayı doğrulayın:
Kaydettiğiniz recipe dosyasını göreceksiniz.
Çalıştırma
1. Önbelleği Temizleme
vLLM’i başlatmadan önce her Spark’ta dosya sistemi önbelleğini boşaltın. Bunu yapmamızın temel sebebi DGX Spark’ın birleşik bellek mimarisi (UMA) olmasıdır: İşletim sistemi, diskten okuduğu model dosyalarını RAM’de önbelleğe alır. vLLM, buradaki model ağırlıklarını GPU belleğine yükler. Yükleme bittikten sonra önbellekte kalan veri bir daha kullanılmayacak olsa da hemen temizlenmez. Ayrı bellek kullanan sistemlerde bu önemli değildir. Çıkarım GPU belleğinde çalıştığından RAM’in doluluğu performansı etkilemez. Spark’ta ise CPU ve GPU aynı RAM’i paylaştığından, önbellek GPU’nun kullanabileceği alanı daraltır. Komut, bu önbelleği boşaltarak vLLM için maksimum bellek sağlar.
Main Spark’ta önbelleği temizleyin:
Main Spark’tan SSH ile Worker Spark’ta da aynı temizliği uygulayın:
2. Başlatma Öncesi Kontroller
sparkrun’ın recipe’yi doğru ayrıştırdığını ve bellek bütçesinin uygun olduğunu doğrulayın:
sparkrun, recipe’yi doğru ayrıştırdı, vllm-distributed’ı seçti ve ‘DGX Spark fit: YES’ onayını verdi.
3. Modeli Başlatma
Şimdi modeli başlatalım:
sparkrun otomatik olarak imajı Worker’a senkronize eder (aynı ID ise atlar), modeli head node’a indirir ve Worker’a dağıtır (zaten varsa atlar), NCCL yapılandırmasını CX-7 arayüzleri için ayarlar ve her Spark’ta konteyner başlatır.
sparkrun 6 adımı başarıyla tamamladı. ‘Mode: cluster (2 nodes)’ görüldü. sparkrun, imajı Worker’a CX-7 ağı üzerinden senkronize etti. Serve command içinde tüm bayraklar doğru çözüldü.
Model indirme tamamlandıktan sonra vLLM’in servise hazır hale gelmesi birkaç dakika alabilir. Bu süreçte vLLM model ağırlıklarını GPU belleğine yükler, GPU çekirdeklerini derler ve çıkarım için bellek ayırır.
vLLM loglarını izlemek için:
Loglarda şunları göreceksiniz:
Application startup complete. satırını gördüyseniz model sunucusu hazır demektir.
Son olarak, sunucunun çalıştığını doğrulayın:
‘HTTP 200’ yanıtı sunucunun sağlıklı olduğunu gösterir.
DeepSeek-V4-Flash-0731 şu an çalışıyor ve Main Spark’ın 8000 portundan servis sağlıyor.
Benchmark
İki Spark üzerinde çalışan DeepSeek-V4-Flash-0731 modelini, farklı eşzamanlılık (concurrency) seviyelerinde test ettik. Ölçümlerde ortalama TTFT (Time to First Token — ilk token’ın üretime başlama süresi) ve TPS (Tokens Per Second — saniye başına üretilen token sayısı) değerleri kaydedilmiştir.
| Eşzamanlılık | TTFT ort. (ms) | TPS ort. (tok/s) |
|---|---|---|
| 1 | 308 | 47.3 |
| 2 | 416 | 32.4 |
| 4 | 532 | 22.5 |
| 8 | 686 | 15.7 |
Ölçümler, CordatusAI LLM Benchmark Tool kullanılarak alınmıştır. Bu araç, CordatusAI tarafından geliştirilen ve OpenAI uyumlu API’lere sahip LLM sunucularını test eden bir benchmarking uygulamasıdır. Görüldüğü üzere, tek eşzamanlılıkta saniyede 47 token değerinin üzerine çıkılmıştır.
OpenCode ile Kullanma
OpenCode, terminalden çalışan açık kaynaklı bir yapay zeka kodlama asistanıdır. Kod yazma, dosya düzenleme, terminal komutları çalıştırma ve kod tabanını analiz etme gibi işlevleri vardır. Bulut servislerinin aksine, OpenCode kendi bilgisayarınızda çalışır ve hangi LLM ile çalışacağını siz seçersiniz.
DeepSeek-V4-Flash-0731 modelinin kodlama ve ajan yeteneklerinden yararlanmak isterseniz, OpenCode’u bu modele bağlayarak yerel bir kodlama asistanı elde edebilirsiniz.
1. Kurulum ve Konfigürasyon
OpenCode’u bilgisayarınıza kurun:
Kurulumu doğrulayın:
Aşağıdaki JSON’ı ~/.config/opencode/opencode.json dosyasına kaydedin. Dosya yoksa oluşturun. yerine Spark’ınızın IP adresini yazın:
Önemli: Bilgisayarınızda halihazırda bir ~/.config/opencode/opencode.json dosyası varsa, kaybetmemek için yedekleyin: cp ~/.config/opencode/opencode.json ~/.config/opencode/opencode.json.bak
2. Kullanım
OpenCode’u, içinde çalışmak istediğiniz proje dizininden başlatın:

Giriş kutusuna mesajınızı yazıp Enter’a basarak modelle sohbete başlayın:

OpenCode’da Tab tuşuyla Build ve Plan modları arasında geçiş yaparsınız. Karmaşık görevlere Plan modunda başlayın. Bu modda OpenCode’un sadece analiz, okuma, araştırma ve planlama izinleri vardır.
Yapılan planı onayladığınızda Build moduna geçebilirsiniz. Bu modda dosya oluşturma, düzenleme ve komut çalıştırma özellikleri de etkindir.
/ ile OpenCode komutlarını kullanabilirsiniz. /models ile kullanılabilir modelleri görebilir, /sessions ile geçmiş oturumlara geçebilir, /undo ile değişiklikleri geri alabilirsiniz.
Diğer komutlar için /help kullanabilirsiniz:
| Komut | Açıklama |
|---|---|
/models |
Kullanılabilir modelleri listeler, model değiştirir |
/init |
Projeyi analiz eder, AGENTS.md oluşturur |
/compact |
Bağlamı sıkıştırır |
/share |
Oturumu paylaşılabilir bağlantıya dönüştürür |
/export |
Oturumu Markdown olarak dışa aktarır |
/thinking |
Modelin düşünce zincirini gösterir veya gizler |
Ayrıca mesajlarınızda @ ile dosya referansı verebilir, ! ile doğrudan terminal komutu çalıştırabilirsiniz.
Karmaşık bir görev verdiğinizde OpenCode, önce görevi analiz eder:

Ardından bir uygulama planı sunar ve belirsiz noktalar için size sorular sorar:

Soruları yanıtladıktan sonra Build moduna geçip dosyaların oluşturulmasına izin verebilirsiniz. Model dosyaları oluşturduktan sonra projeyi doğrulayabilirsiniz:

3. Örnek Kullanım
OpenCode’u öğrendiğinize göre, modelin kodlama ve zeka yeteneklerini denemek için daha zorlu bir görev verelim. Yeni bir oturum başlatın, Tab ile Build moduna geçin ve aşağıdaki prompt’u gönderin:
Bu prompt, modelin tek bir dosya içinde vektör tabanlı fizik, dönen cisimlerle çarpışma hesaplama ve Canvas API kullanımı gibi birden fazla zorlu konuyu doğru şekilde entegre etmesini gerektirir.

Model, prompt’u analiz eder ve dosyayı oluşturmaya başlar:

Oluşturulan hexagon.html dosyasını tarayıcıda açarak simülasyonu test edebilirsiniz. Topun, dönen altıgenin içinde gerçekçi fizik kurallarına uyarak sektiğini göreceksiniz:

Dilerseniz, aynı promptu başka modellerle de deneyip sonuçları karşılaştırabilirsiniz.
Kapatma
İşiniz bittiğinde modeli durdurun:
Bu komutla konteyner durdurulur ve bellek alanı boşalır. Ama konteyner, Docker imajı ve model dosyaları diskte kalır. Böylelikle tekrar başlatmak için yeniden indirme yapmanız gerekmez. 3. adımdaki sparkrun run komutunu tekrar çalıştırmanız yeterli.
OPENZEKA HABERLERİ
Tavsiye Edilen Ürünler
OPENZEKA HABERLERİ
Hesaplarınızda paylaşmak ister misiniz?





