Okuma 16.1 dkKategoriler: AI, LOKAL LLM'LER

Kaynaklar, Araçlar ve Topluluk

NVIDIA DGX Spark™, yapay zeka modelleriyle çalışmak isteyenler için tasarlanmış kompakt bir masaüstü AI sistemidir. Geliştirme, test, çıkarım, ince ayar ve prototipleme süreçlerini tek bir platformda toplar.

Cihaz etrafında oluşan yazılım ve bilgi ekosistemi oldukça güçlüdür: modeller, Docker imajları, NVIDIA playbook’lar ve forumlar, bu ekosistem unsurlarının sadece birkaçıdır. Bununla beraber, DGX Spark ile geliştirme yapan oldukça geniş bir topluluk da mevcut. Bu topluluğun ürettiği imajlar, çoklu cihaz reçeteleri, araçlar, yazılım geliştirmeleri ve performans sıralamaları, ekosistemi resmi kaynakların ötesine taşıdı.

Modeller

DGX Spark üzerinde çalıştırılacak modeller HuggingFace‘te barındırılır ve çoğu, çeşitli kuantizasyon formatlarıyla birlikte gelir. Bir modelin HuggingFace’te FP8, NVFP4, MXFP4 veya INT4 gibi çeşitli varyantları bulunabilir. DGX Spark, tüm bu formatları donanımsal olarak destekler; model indirildikten sonra ek bir dönüştürme gerekmeksizin çalıştırılabilir.
Bu kuantizasyon formatları arasında NVFP4, DGX Spark’ın Blackwell mimarisine özgü bir FP4 formatıdır. Model ağırlıklarını daha düşük bit genişliğiyle temsil ederek bellek kullanımını önemli ölçüde azaltır — 200 milyar parametreli bir model, varsayılan 16-bit formatta yaklaşık 400 GB bellek gerektirirken NVFP4 ile dörtte bir kadarına iner. Bu sayede 128 GB birleşik bellekte çok daha büyük modellerin çalıştırılmasına olanak tanır.
HuggingFace‘te NVIDIA’nın dönüştürdüğü 100’e yakın NVFP4 modelinden oluşan koleksiyon bulunuyor. Ayrıca, topluluk tarafından da Spark’a özel birçok model yayınlandı.

Çıkarım Motorları

Çıkarım motorları, model ağırlıklarını GPU belleğine yükleyen ve dışarıdan istek kabul etmek için API sunan yazılımlardır. Sunulan bu API’ı ise, Open WebUI, Odysseus veya herhangi bir istemci ile kullanılır. vLLM, SGLang, TensorRT-LLM ve llama.cpp gibi çeşitli çıkarım motorları bulunmaktadır.

DGX Spark üzerinde en yaygın kullanılan çıkarım motoru vLLM’dir. Bunun başlıca nedeni, vLLM’in dağıtık çalıştırma senaryolarındaki başarısıdır. Özellikle çoklu düğüm (multinode) tensor parallelism desteğinin güçlü olması sayesinde, çoklu Spark kurulumlarında maksimum verim sağlanır. Bununla beraber, vLLM’in PagedAttention ile GPU belleğini verimli kullanması, Prefix caching ile tekrarlayan sorgularda önceki hesaplamaları yeniden kullanabilmesi, FP8 veya NVFP4 gibi düşük hassasiyetli KV cache formatlarını desteklemesi de önemli faktörlerdir.

vLLM, Docker konteynerlerinde çalıştırılır. Tüm GPU bağımlılıklarıyla birlikte paketlenmesi için Docker imajları kullanılır. Resmi vLLM imajları, Docker Hub’da vllm/vllm-openai altında yayınlanmaktadır.

Topluluk

DGX Spark’ın GB10 çipi, standart NVIDIA GPU’larından farklı olarak SM 12.1 compute capability kullanır. vLLM gibi çıkarım motorlarının resmi Docker imajları bu mimari için native kernel içermeyebilir: Yani resmi vLLM imajlarıyla modeller çalışırlar ancak bazı modeller Spark’ın GPU’sunun tam performansından yararlanmıyor olabilir. Bu yüzden bazen özel imaj ve reçetelere ihtiyaç duyulur.

Geliştiriciler

Topluluk geliştiricileri, GB10 için native SM 12.1a kernel’larına sahip Docker imajları geliştirip yayınlar. Bu sebeple Spark ile çalışırken, resmi vLLM imajlarının yanında topluluk imajlarından da sıklıkla yararlanılır.

Spark’lar için en büyük topluluk geliştiricileri ve katkıları aşağıdaki tabloda özetlenmiştir. Bu listeye her gün yeni geliştiriciler eklendiği unutulmamalıdır:

  • eugr: spark-vllm-docker — Genel amaçlı çıkarım imajları, MXFP4 build’leri, B12X kernel ailesi
  • christopherowen: vllm (fork) — CUTLASS ve FlashInfer kernel’larının kaynak kodu
  • local-inference-lab: vllm (fork) — B12X kernel ailesinin kaynağı, sm12x mimarisi için deneysel yüksek performanslı kernel’lar
  • tonyd2wild: tonyd2wild — Modele özel imajlar, çoklu Spark kurulum reçeteleri (DeepSeek V4 Flash, GLM-5.2, MiMo V2.5, MiniMax-M3), DSpark speculative decoding yamaları
  • mpfaffenberger: mpfaffenberger — Model uyumluluk sorunları için runtime mod’ları
  • MiaAI-Lab: MiaAI-Lab — Topluluk reçete üreticisi; DeepSeek V4 Flash, GLM-5.2, Laguna S dağıtım reçeteleri ve sparkDash monitörleme aracı

Bununla beraber, Spark Arena, DGX Spark üzerinde çeşitli modellerin ve çıkarım motorlarının performansını sıralayan bir LLM performans sıralaması da yürütüyor.

Araçlar

Tek bir DGX Spark üzerinde model çalıştırmak için Docker yeterlidir. Ancak çoklu Spark kurulumlarında Docker konteynerlerini manuel olarak yönetmek, küme oluşturmak, CX-7 ağı, SSH mesh’i, NCCL iletişimini yapılandırmak karmaşık bir süreç haline gelebilir. Bu süreci kolaylaştırmak için topluluk çeşitli araçlar geliştirmiştir:

eugr/spark-vllm-docker, eugr tarafından geliştirilmiştir. GB10 için native SM 12.1a kernel’larına sahip Docker imajları oluşturmaya yarayan en kapsamlı araç setidir. Build scriptleri, küme başlatma, reçete dağıtımı, model indirme, düğüm keşfi, runtime mod’ları ve hazır reçeteler içerir. Bu araçlar, topluluk tarafından sıklıkla kullanılır.

sparkrun ise Spark Arena tarafından geliştirilmiştir. Küme yönetimini otomatize eder. Kurulum sihirbazı sayesinde CX-7 ağı, SSH mesh ve NCCL yapılandırmasını tek komutla gerçekleştirir; sonrasında YAML formatındaki bir reçete dosyası üzerinden model adını, Docker imajını, çıkarım ayarlarını ve bellek yapılandırmasını uygular. Ayrıca, kapsamlı bir gerçek zamanlı küme izleme özelliği mevcuttur. DGX Spark ekosisteminde yaygın kullanılan bir küme yönetim aracıdır.

OpenZeka Kaynakları

OpenZeka olarak, DGX Spark üzerinde gerçekleştirilen çalışmaların Türkçe ve İngilizce eğitimlerini blog.openzeka.com adresinde yayınlıyoruz. Blog içerikleri çoğunlukla kullanıcı eğitimi odaklı. Öğretici yazılar, adım adım model ve araç kurulum talimatları ve pratik kullanım rehberleri. Aşağıdaki tabloda ilgili blog yazılarımızın bazılarını görebilirsiniz:

White paper’larımız ise whitepapers.openzeka.com adresinde yayınlanır. Blog’un kullanıcı eğitimi odaklı içeriğinin aksine, white paper’lar daha teknik ve profesyonel okuyucuyu hedef alır: donanım seçim rehberleri, benchmark analizleri, küme mimarisi karşılaştırmaları ve ölçekleme stratejileri gibi karar verme süreçlerini destekleyen derinlemesine analizler sunar. Aşağıdaki tabloda bazı white paper’larımızı görebilirsiniz:

Ayrıca, OpenZeka ve CordatusAI YouTube kanallarımızda birçok eğitim, test ve ürün analiz videomuz mevcut.

Forum ve Dokümanlar

NVIDIA Geliştirici Forumu’nun DGX Spark / GB10 kategorisi, NVIDIA mühendislerinin de aktif olarak katıldığı bir topluluk tartışma alanıdır. Model çalıştırma reçeteleri, performans optimizasyonu, yeni çıkan modeller ve daha birçok konuda yüzlerce tartışma bulunuyor. DGX Spark ile ilgili herhangi bir sorunla karşılaşıldığında ilk bakılacak kaynaklardan biri. NVIDIA Developer sayfası ise bu forumu, dokümantasyon ve playbook bağlantılarıyla birlikte tek bir yerde toplar.

DGX Spark için resmi dokümantasyon docs.nvidia.com/dgx/dgx-spark adresinde yer alır. Kullanım Kılavuzu donanım özellikleri, DGX OS, ConnectX-7 kümeleme, sistem kurtarma ve bilinen sorunları kapsar; donanım özellikleri, OS ve bileşen güncelleme ve sürüm notları alt sayfalarıyla birlikte. Çoklu Spark kurulumu için NVIDIA Sync Cluster Assistant ve ağ denetleme dokümanları, performans analizi için ise Nsight Systems ve Nsight Compute araçlarının dokümanları mevcuttur.

Spark Playbook Kataloğu

NVIDIA, DGX Spark için Spark Playbook sayfasında playbook’lar sunuyor. Her playbook, belirli bir araç veya iş akışı için adım adım kurulum ve çalıştırma talimatları içerir. Bu araçlardan bazıları doğrudan model çalıştırırken bazıları bu modelleri kullanıma hazır hâle getirir.

Çıkarım Motorları

Modeller genellikle PyTorch veya JAX gibi ML framework’leriyle geliştirilir. Çıkarım motorları bu süreçte üretilen model ağırlıklarını yükler veya dönüştürür; GPU kernel’leri, KV cache, batching ve bellek kullanımını optimize ederek modeli çalıştırır. Bazıları, yerleşik veya ayrı bir model sunucu bileşeni üzerinden OpenAI uyumlu API sunabilir.

  • TensorRT-LLM: trt-llm — TensorRT-LLM, NVIDIA GPU’larında LLM çıkarımını optimize eden açık kaynaklı çıkarım kütüphanesidir. Optimize edilmiş kernel’ler ile tensor, pipeline ve sequence parallelism yöntemlerini kullanır. Hugging Face ve PyTorch’a entegredir.
  • vLLM: vllm — vLLM, PagedAttention ve continuous batching ile bellek kaybını azaltan, yüksek throughput odaklı çıkarım motorudur. Aynı zamanda OpenAI uyumlu model sunucusu sağlar.
  • llama.cpp: llama-cpp — llama.cpp, GGUF modellerini CPU ve farklı GPU backend’lerinde çalıştıran hafif bir C/C++ çıkarım motorudur. llama-server bileşeniyle OpenAI uyumlu API sunabilir.
  • SGLang: sglang — SGLang, LLM ve VLM’ler için yüksek performanslı çıkarım ve model sunumu framework’üdür. Backend runtime ile model etkileşim katmanını birlikte optimize eder.
  • NVIDIA NIM: nim-llm — NIM, yukarıdaki çıkarım motorlarını konteynerleştirilmiş bir HTTP mikroservisi olarak paketleyen NVIDIA çözümüdür. Kendisi bağımsız bir çıkarım motoru değil, bu motorları kurumsal kullanım için hazırlaştıran bir paketleme katmanıdır.

Uygulamalar ve Araçlar

Bu araçlar, kullanıcıların ve geliştiricilerin modellerle doğrudan etkileşime girmesini sağlar. Live VLM WebUI ve Continue mevcut bir backend servisine bağlanırken, Ollama ve LM Studio kendi çıkarım motorunu da içerir.

  • Ollama + Open WebUI: open-webui — Ollama, llama.cpp üzerine inşa edilmiş yerel model serving katmanıdır; CLI, model kütüphanesi ve OpenAI uyumlu API sunar. Open WebUI ise bu servise bağlanan self-hosted web arayüzüdür.
  • LM Studio: lm-studio — LM Studio, modelleri bulma, çalıştırma ve API üzerinden sunma işlevlerini birleştiren yerel AI uygulamasıdır.
  • Live VLM WebUI: live-vlm-webui — Live VLM WebUI, webcam akışını Ollama, vLLM, SGLang veya bulut tabanlı VLM servislerine gönderen web arayüzüdür. Backend modellerin çıktısını ve performansını karşılaştırır.
  • Continue + VS Code: vibe-coding — Continue, VS Code içinde çalışan kodlama istemcisidir. Playbook’ta model Ollama tarafından sunulur; Continue bu servisi sohbet ve kod üretimi için kullanır.

Modeller ve Çıkarım Optimizasyonları

Nemotron, NVIDIA’ya ait bir model ailesidir. Speculative decoding ve NVFP4 ise uyumlu çıkarım motorlarının performansını veya bellek verimliliğini artıran tekniklerdir.

  • NVIDIA Nemotron: nemotron — Nemotron, NVIDIA’nın akıl yürütme, araç kullanımı ve uzun bağlamlı görevler için geliştirdiği açık model ailesidir. llama.cpp, vLLM, SGLang veya TensorRT-LLM ile sunulabilir.
  • Speculative decoding: speculative-decoding — Speculative decoding, küçük ve hızlı bir tahmin modelinin önerdiği token’ları ana modelin toplu olarak doğrulamasıyla decode sürecini hızlandırır. Playbook bu tekniği TensorRT-LLM üzerinde EAGLE-3 ve Draft–Target yöntemleriyle gösterir.
  • NVFP4 kuantizasyonu: nvfp4-quantization — NVFP4, model ağırlıkları ve aktivasyonlar için Blackwell uyumlu 4-bit kuantizasyon formatıdır. Playbook, TensorRT Model Optimizer ile dönüştürülen modeli TensorRT-LLM ortamında çalıştırır.

İnce Ayar Framework’leri ve Araçları

İnce ayar araçları, var olan model ağırlıklarını kullanarak yeni model ağırlıkları üretir; ortaya çıkan model daha sonra bir çıkarım motoruyla çalıştırılır.

PyTorch temel ML framework’üdür. NeMo, LLaMA-Factory ve Unsloth ise PyTorch üzerinde daha kullanıma hazır ve optimize edilmiş eğitim iş akışları sunar.

  • NVIDIA NeMo: nemo-fine-tune — NeMo AutoModel, Hugging Face modellerini native PyTorch desteğiyle eğiten ve çok düğümlü sistemlere ölçeklenebilen framework’tür. SFT, PEFT ve dağıtık eğitim iş akışlarını destekler.
  • LLaMA-Factory: llama-factory — LLaMA-Factory, farklı LLM ve VLM’lerde SFT, LoRA ve QLoRA gibi optimizasyon yöntemlerini ortak bir arayüzle uygulayan ince ayar framework’üdür.
  • Unsloth: unsloth — Unsloth, özel GPU kernel’leriyle LoRA ve QLoRA eğitimini hızlandıran ve bellek kullanımını azaltan ince ayar araç setidir.
  • PyTorch: pytorch-fine-tune — PyTorch, tensor işlemleri, otomatik türev alma ve GPU hızlandırması sağlayan temel ML framework’üdür. Bu playbook, SFT, LoRA ve QLoRA süreçlerini daha düşük seviyede doğrudan PyTorch üzerinden yürütür.
  • FLUX.1 DreamBooth LoRA: flux-finetuning — Bu playbook, FLUX.1-dev difüzyon görüntü üretim modeline yeni kavramlar ve stiller öğretmek için DreamBooth LoRA kullanır.

Ajan AI Sistemleri

Ajanlar, karar vermek için bir LLM servisine bağlanır; dosyalar, terminal komutları, API’ler ve diğer araçlarla etkileşime geçer. Model vLLM veya Ollama gibi bir servis tarafından çalıştırılırken ajan uygulaması görev planlama, bellek ve araç kullanımını yönetir.

OpenClaw ve Hermes ajan uygulamalarıdır. OpenShell, ajan sürecini dosya sistemi, ağ, yetki ve güvenlik politikalarıyla çevreleyen sandbox runtime’ıdır. NemoClaw ise bu katmanları kullanıma hazır biçimde birleştirir.

  • OpenClaw: openclaw — OpenClaw, kalıcı bellek, dosya erişimi, araç kullanımı ve becerileri birleştiren sürekli çalışan yerel ajan uygulamasıdır. Playbook’ta karar verme modeli vLLM tarafından sunulur.
  • Hermes Agent: hermes-agent — Hermes, deneyimlerinden yeniden kullanılabilir beceriler üreten, oturumlar arasında bellek tutan ve zamanlanmış görevler çalıştırabilen otonom ajandır. Playbook’ta yerel model servisi olarak vLLM kullanılır.
  • OpenShell: openshell — OpenShell, ajanları kernel düzeyinde sınırlandıran sandbox runtime’ıdır. Playbook, OpenClaw’ı sandbox içinde çalıştırır ve model servisi sandbox dışındaki endpoint üzerinden sağlanır.
  • NemoClaw: nemoclaw — NemoClaw, OpenClaw ajanını, OpenShell sandbox’ını ve yerel vLLM çıkarımını bir araya getirir. Dosya sistemi, ağ, süreç ve çıkarım erişimlerini ortak bir kurulumda yapılandırır.
  • NemoClaw örnek ajanları: nemoclaw-applications — Bu playbook, mevcut bir NemoClaw sandbox’ı üzerinde haber özeti, yazılım geliştirme, doküman inceleme ve takvim müzakere ajanları kurar. Böylece aynı altyapının farklı görev uygulamalarına nasıl dönüştürüldüğünü gösterir.
  • CLI Coding Agents: cli-coding-agent — Claude Code, OpenCode ve Codex CLI; dosya düzenleme, komut çalıştırma ve kod görevlerini yöneten terminal ajanlarıdır. Playbook’ta model çıkarımı Ollama tarafından sağlanır.

Tamamlanmış AI Uygulamaları ve Çözümleri

Bu uygulamalar model, çıkarım motoru, veri işleme, arayüz ve ajan bileşenlerini belirli bir problemi çözmek üzere bir araya getirir. Kullanıcı ayrı ayrı alt katmanlarla değil, tamamlanmış sistemle etkileşime girer.

  • RAG Application in AI Workbench: rag-ai-workbench — Sorgu yönlendirme, bilgi getirme, cevap üretme ve halüsinasyon değerlendirme aşamalarını birleştiren agentic RAG uygulamasıdır. NVIDIA-hosted API’leri veya self-hosted model servislerini kullanabilir.
  • Video Search and Summarization: vss — VSS, VLM, LLM ve RAG bileşenlerini kullanarak videolardan özet, soru-cevap ve gerçek zamanlı uyarılar üretir.
  • Çoklu ajan sohbet botu: multi-agent-chatbot — Supervisor ajan, kodlama, RAG ve görüntü anlama ajanlarını birlikte yönetir. Model sunumu için llama.cpp ve TensorRT-LLM sunucuları, araç bağlantıları için MCP kullanılır.
  • TensorRT ile görüntü üretimi: multi-modal-inference — Bu playbook, FLUX.1 ve SDXL difüzyon modellerini TensorRT ile optimize ederek metinden görüntü üretir.
  • Text to Knowledge Graph: txt2kg — Ollama ile metinden subject–predicate–object ilişkileri çıkarır, sonuçları ArangoDB’de saklar ve Three.js WebGPU ile görselleştirir. Ollama çıkarımı, ArangoDB ise ilişki sorgularını yürütür.
  • Spark & Reachy Photo Booth: spark-reachy-photo-booth — NeMo Agent Toolkit, TensorRT-LLM, konuşma tanıma, konuşma üretimi, FLUX görüntü üretimi ve nesne takibini Reachy Mini robotuyla birleştiren multimodal uygulamadır. Servisler bir message bus üzerinden haberleşir.

Diğer GPU Hızlandırmalı İş Yükleri

Bu playbook’lar AI çıkarım ve sunum süreçlerinin parçası değildir. DGX Spark’ın işlem hızlandırma olanaklarından veri bilimi, optimizasyon, biyoinformatik ve robotik gibi diğer alanlarda faydalanılmasıyla ilgilidir.

  • CUDA-X Data Science: cuda-x-data-science — CUDA-X Data Science, cuDF ve cuML gibi RAPIDS kütüphaneleriyle pandas ve scikit-learn iş akışlarını GPU üzerinde hızlandırır.
  • Single-cell RNA Sequencing: single-cell — RAPIDS-singlecell, Scanpy benzeri API ile scRNA-seq ön işleme, kalite kontrolü, kümeleme ve görselleştirme işlemlerini GPU üzerinde yürütür. cuML ve cuGraph gibi RAPIDS bileşenlerini kullanır.
  • Portfolio Optimization: portfolio-optimization — cuOpt, portföy kısıtlarını LP/MILP optimizasyonu olarak çözer; cuML ise risk senaryolarının üretilmesini hızlandırır. Playbook bu araçları Mean-CVaR tabanlı uçtan uca bir finans iş akışında birleştirir.
  • Isaac Sim ve Isaac Lab: isaac — Isaac Sim, GPU hızlandırmalı robotik simülasyon platformudur. Isaac Lab, bu ortamın üzerinde pekiştirmeli öğrenme politikaları geliştiren framework’tür.

Çoklu DGX Spark Kullanımı

Bu playbook’lar model veya uygulama katmanından bağımsız olarak çoklu cihaz altyapısını hazırlar. Önce QSFP ağı ve düğümler arası SSH erişimi kurulur; ardından NCCL bu bağlantı üzerinden dağıtık eğitim ve çıkarım için GPU’lar arası kolektif iletişimi sağlar.

vLLM, TensorRT-LLM, PyTorch ve NeMo gibi üst katman yazılımları dağıtık çalışırken bu altyapıdan yararlanabilir.

  • 2× DGX Spark doğrudan bağlantı: connect-two-sparks — İki DGX Spark’ı doğrudan 200 GbE QSFP bağlantısı ve passwordless SSH ile iki düğümlü dağıtık sisteme dönüştürür.
  • 3× DGX Spark halka bağlantısı: connect-three-sparks — Üç DGX Spark’ı üç QSFP kablosuyla halka topolojisinde bağlar.
  • 4+ DGX Spark switch bağlantısı: multi-sparks-through-switch — Dört veya daha fazla DGX Spark’ı QSFP switch üzerinden ölçeklenebilir bir kümeye dönüştürür.
  • NCCL: nccl — NCCL, farklı düğümlerdeki GPU’lar arasında yüksek performanslı kolektif iletişim sağlayan NVIDIA kütüphanesidir.

Bu playbook’ların tamamına build.nvidia.com/spark adresinden erişilebilir.

Sonuç

DGX Spark, temellerini NVIDIA’nın attığı ve çeşitli topluluk projeleriyle günbegün büyüyen canlı ve güçlü bir ekosisteme sahiptir. OpenZeka ise yayınladığı Türkçe ve İngilizce eğitimler, teknik analiz dokümanları, rehberler ve YouTube videolarıyla bu ekosistemdeki bilgiyi son kullanıcı için erişilebilir kılar.

OPENZEKA HABERLERİ

Abone olmak ister misiniz?

Hemen ilgilendiğiniz alanları seçerek bültenimizden haberdar olabilirsiniz.

Kategoriler

OPENZEKA HABERLERİ

Abone olmak ister misiniz?

Hemen ilgilendiğiniz alanları seçerek bültenimizden haberdar olabilirsiniz.

Kategoriler

Hesaplarınızda paylaşmak ister misiniz?

İlgili Yazılar