Okuma 10.9 dkKategoriler: AI, LOKAL LLM'LER, Openzeka

Edge cihazda büyük dil modeli çalıştırmak, artık “çalışır mı?” sorusundan çok “ne kadar akıcı çalışır?” sorusuna evrildi. Bu yazıda, Jetson cihaz ailesinde hangi modellerin çalıştığını, hangi nicemleme ve runtime kombinasyonunun ne kadar hız verdiğini, ve en önemlisi — farklı hızların ekranda nasıl hissettirdiğini ele alacağız.

Hız Nasıl Hissedilir? — 20 / 60 / 200 tok/s

“TokensPerSec” (saniye başına token) sayısı, tek başına bir anlama gelir mi? Aşağıdaki 3 saniyelik screencast’ler, üç farklı decode hızının ekrandaki hissiyatını gösteriyor. Soldan sağa: yavaş, orta, akıcı.

≈20 tok/s — yavaş, harf harf akar

≈60 tok/s — orta, okunabilir tempo

≈200 tok/s — akıcı, anlık akar

Bazı Terimler

  • Decode (Çözümleme): Modelin ürettiği her yeni token’ı kullanıcıya aktardığı aşamadır. Prompt işlendiikten sonra başlayan bu fazın hızı genellikle tok/s değeriyle ölçülür.
  • TokensPerSec (tok/s): Modelin saniyede ürettiği token sayısını ifade eder. Değer yükseldikçe model daha akıcı ve hızlı yanıt üretir.
  • Concurrency (Eşzamanlılık): Aynı anda işlenen istek sayısıdır. Örneğin c=1 tek kullanıcıyı, c=5 ise beş eşzamanlı isteği temsil eder. Eşzamanlılık arttıkça toplam throughput yükselirken, kullanıcı başına düşen hız azalabilir.
  • Runtime: Büyük dil modelini çalıştıran çıkarım (inference) motorudur.
  • vLLM: Yüksek throughput sağlayan, PagedAttention mimarisini kullanan çıkarım motorudur. Jetson platformunda en geniş model desteğini sunar ve 48 modelden 45’ini çalıştırabilir.
  • SGLang: Özellikle sunucu tarafında yüksek eşzamanlı istekleri verimli şekilde işlemek için optimize edilmiş bir çıkarım motorudur.
  • Ollama: Jetson üzerinde kolay kurulum ve kullanım sunan popüler bir runtime’dır. Yaklaşık 13 modeli destekler.
  • llama.cpp: CPU ve GPU’yu birlikte kullanabilen hafif bir çıkarım motorudur. Jetson’da özellikle Gemma ve Cosmos ailesi olmak üzere yaklaşık 12 modeli destekler.
  • Quant (Nicemleme): Model ağırlıklarının daha düşük hassasiyette saklanarak bellek kullanımının azaltılması işlemidir.
  • BF16: 16-bit kayan nokta formatıdır. En yüksek doğruluğu sunarken en fazla belleği kullanır.
  • FP8: 8-bit kayan nokta formatıdır. BF16’ya göre yaklaşık iki kat bellek tasarrufu sağlar.
  • NVFP4: NVIDIA’nın 4-bit kayan nokta formatıdır. Büyük MoE modellerinin edge cihazlara sığmasını mümkün kılar.
  • INT4: 4-bit tamsayı nicemleme yöntemidir. En yüksek sıkıştırma oranını sağlar.
  • PRISMAQUANT: Yaklaşık 4.75-bit gibi karışık hassasiyet kullanan nicemleme yaklaşımıdır. Kalite ile performans arasında denge kurmayı amaçlar.
  • Cluster: Modelin çalıştırıldığı sistem yapısını ifade eder. Single tek makineyi, 2 Nodes ve 4 Nodes ise birden fazla makineden oluşan kümeleri belirtir. Jetson tek cihaz olduğu için Single kategorisine girer.
  • VLM (Vision-Language Model): Görüntü ve metni birlikte işleyebilen yapay zekâ modelleridir. Desteklenen 48 modelin 26’sı bu sınıftadır.
  • MoE (Mixture of Experts): Her token için modelin yalnızca gerekli alt ağlarını etkinleştiren mimaridir. Örneğin 35B-A3B, toplam 35 milyar parametre bulunmasına rağmen her token için yaklaşık 3 milyar parametrenin aktif olduğu anlamına gelir. Bu yapı, büyük modellerin daha yüksek hızla çalışmasını sağlayarak özellikle Jetson gibi edge cihazlarda önemli avantaj sunar.

Jetson Cihaz Başına Model Desteği

Aşağıdaki tablo, NVIDIA Jetson AI Lab tarafından desteklenen üretken yapay zekâ modellerinin farklı Jetson platformları ve iş istasyonu GPU’ları üzerindeki çalışabilirlik durumunu göstermektedir. Tabloda yer alan her model için ilgili donanımda desteklenme durumu belirtilmiştir. işareti modelin ilgili cihaz üzerinde çalıştırılabildiğini, işareti ise desteklenmediğini ifade eder. Bu bilgiler, belirli bir Jetson platformu için uygun modeli seçme, donanım gereksinimlerini değerlendirme ve uygulama geliştirme süreçlerinde hızlı bir başvuru kaynağı sunmayı amaçlamaktadır.

Tabloda sunulan model uyumluluk bilgileri, Jetson AI Lab – Supported Models sayfasından derlenmiştir. Jetson AI Lab, Jetson platformlarında büyük dil modelleri (LLM), görsel-dil modelleri (VLM) ve diğer üretken yapay zekâ modellerinin çalıştırılmasına yönelik resmî örnekler, optimizasyonlar ve güncel destek durumlarını sağlamaktadır. Model desteği zaman içerisinde değişebileceğinden, en güncel bilgiler için ilgili sayfanın takip edilmesi önerilir.

Model Aile VLM Nano 8GB NX 16GB AGX Orin 64GB T4000 T5000
Gemma 3 270M Google Gemma3
Qwen3.5 0.8B Alibaba Qwen3.5 VLM
Gemma 3 1B Google Gemma3
Cosmos Reason 2 2B NVIDIA Cosmos Reason VLM
Llama 3.2 3B Meta Llama 3
Ministral 3 3B Instruct Mistral AI Ministral 3 VLM
Ministral 3 3B Reasoning Mistral AI Ministral 3 VLM
Nemotron3 Nano 4B NVIDIA Nemotron
Qwen3 4B Alibaba Qwen3
Qwen3.5 4B Alibaba Qwen3.5 VLM
Qwen3 VL 4B Alibaba Qwen3 VLM
Gemma 3 4B Google Gemma3 VLM
FunctionGemma Google Gemma3
Cosmos Reason 1 7B NVIDIA Cosmos Reason VLM
Gemma 4 E2B Google Gemma4 VLM
Llama 3.1 8B Meta Llama 3
Ministral 3 8B Instruct Mistral AI Ministral 3 VLM
Ministral 3 8B Reasoning Mistral AI Ministral 3 VLM
Qwen3 8B Alibaba Qwen3
Qwen3 VL 8B Alibaba Qwen3 VLM
Cosmos Reason 2 8B NVIDIA Cosmos Reason VLM
Nemotron Nano 9B v2 NVIDIA Nemotron
Qwen3.5 9B Alibaba Qwen3.5 VLM
Gemma 3 12B Google Gemma3 VLM
Nemotron Nano 12B VL NVIDIA Nemotron VLM
Ministral 3 14B Instruct Mistral AI Ministral 3 VLM
Ministral 3 14B Reasoning Mistral AI Ministral 3 VLM
Gemma 4 12B Google Gemma4 VLM
Gemma 4 E4B Google Gemma4 VLM
Qwen3.5 27B Alibaba Qwen3.5
Qwen3.6 27B Alibaba Qwen3.6
Gemma 3 27B Google Gemma3 VLM
Llama 3.1 70B Meta Llama 3
Nemotron3 Nano 30B-A3B NVIDIA Nemotron
Qwen3 30B-A3B (MoE) Alibaba Qwen3
Qwen3.5 35B-A3B (MoE) Alibaba Qwen3.5
Qwen3.6 35B-A3B (MoE) Alibaba Qwen3.6
Gemma 4 26B-A4B Google Gemma4 VLM
DiffusionGemma 26B-A4B Google Gemma4
Gemma 4 31B Google Gemma4 VLM
Qwen3 32B Alibaba Qwen3
GPT OSS 20B OpenAI GPT OSS
Cosmos3 Edge New NVIDIA Cosmos VLM
Cosmos3 Nano New NVIDIA Cosmos VLM
Nemotron 3 Nano Omni NVIDIA Nemotron VLM
MiniMax M2.7 MiniMax M2.7
GPT OSS 120B OpenAI GPT OSS

Performans Tabloları — Spark Arena

Aşağıdaki performans tabloları, farklı büyük dil modellerinin decode aşamasında ölçülen saniyedeki token üretim hızlarını (tok/s) karşılaştırmaktadır. Sonuçlar; model, nicemleme (quant), çıkarım motoru (runtime), küme yapısı (cluster) ve eşzamanlı istek sayısı (concurrency) gibi farklı yapılandırmalar altında elde edilmiştir. Böylece farklı donanım ve yazılım kombinasyonlarının performans üzerindeki etkisi karşılaştırılabilir.

Bu bölümde yer alan veriler, Spark Arena Leaderboard sayfasından derlenmiştir. Spark Arena, farklı yapay zekâ modellerinin ve çıkarım motorlarının performansını standart test senaryoları kullanarak karşılaştıran güncel bir benchmark platformudur. Sonuçlar zaman içerisinde değişebileceğinden, en güncel performans değerleri için ilgili leaderboard sayfasının incelenmesi önerilir.

Concurrency = 1 (tek kullanıcı)

tok/s Model Quant Runtime Cluster
188.47 LFM2.5-350M BF16 vLLM Single
116.03 Qwen3.6-35B-A3B NVFP4 vLLM Single
109.81 Qwen3.5-0.8B BF16 vLLM Single
106.16 Qwen3.6-35B-A3B NVFP4 vLLM Single
106.16 Qwen3.6-35B-A3B NVFP4 vLLM Single
97.74 Qwen3.5-0.8B BF16 SGLang Single
50.90 Qwen3-Coder-Next FP8 SGLang 2 nodes
Concurrency = 2
tok/s Model Quant Runtime Cluster
325.44 LFM2.5-350M BF16 vLLM Single
179.48 Qwen3.5-0.8B BF16 vLLM Single
178.85 gemma-3-1b-it BF16 vLLM Single
178.29 Qwen3.6-35B-A3B NVFP4 vLLM Single
165.88 Qwen3.6-35B-A3B NVFP4 vLLM Single
154.39 Qwen3.5-0.8B BF16 SGLang Single
57.52 Qwen3-Coder-Next FP8 SGLang 2 nodes
40.23 Minimax-M3-v0 NVFP4 SGLang 4 nodes
37.69 Minimax-M3-v0 NVFP4 SGLang 4 nodes
Concurrency = 4 ( Büyük modeller )
tok/s Model Quant Runtime Cluster
46.68 Gemma-4-26B-A4B NVFP4 vLLM Single
42.03 Qwen3.5-122B-A10B INT4 vLLM Single
39.58 Gemma-4-26B-A4B NVFP4 vLLM Single
26.69 DeepSeek-V4-Flash-180B FP8 vLLM Single
25.89 DeepSeek-V4-Flash-162B FP8 vLLM Single
Concurrency = 5
tok/s Model Quant Runtime Cluster
428.95 LFM2.5-350M BF16 vLLM Single
230.47 Qwen3.5-0.8B BF16 vLLM Single
214.15 gemma-3-1b-it BF16 vLLM Single
193.49 Qwen3.6-35B-A3B NVFP4 vLLM Single
191.15 Qwen3.5-0.8B BF16 SGLang Single
186.64 Qwen3.6-35B-A3B PRISMAQUANT vLLM Single
73.81 Qwen3.6-27B FP8 SGLang Single
63.55 Minimax-M3-v0 NVFP4 SGLang 4 nodes
57.99 Minimax-M3-v0 NVFP4 SGLang 4 nodes
53.83 Qwen3-Coder-Next FP8 SGLang 2 nodes

Hangi Jetson Cihazı Hangi Modeller İçin Uygun?

Jetson platformları farklı bellek kapasiteleri ve işlem güçlerine sahip olduğundan, çalıştırabilecekleri model boyutları da değişiklik gösterir. Küçük modeller için giriş seviyesi bir Jetson yeterli olurken, daha büyük LLM ve VLM modelleri için daha yüksek bellek kapasitesine sahip cihazlara ihtiyaç duyulur. Bu nedenle model seçimi yapılırken yalnızca parametre sayısı değil, kullanılacak nicemleme yöntemi (BF16, FP8, NVFP4 vb.) ve hedef uygulamanın gerçek zamanlı performans gereksinimleri de dikkate alınmalıdır.

Senaryo Önerilen Cihaz Açıklama
Küçük LLM’ler (270M–4B) Orin Nano 8GB Temel sohbet botları, eğitim ve hafif çıkarım uygulamaları için uygundur.
Orta boy modeller (7B–14B) Orin NX 16GB Daha gelişmiş edge yapay zekâ uygulamaları ve VLM’ler için dengeli bir seçenektir.
Büyük MoE modelleri (27B–35B) AGX Orin 64GB Yüksek performanslı edge çıkarım uygulamaları için önerilir.
En büyük LLM’ler RTX T4000 / RTX T5000 120B sınıfına kadar büyük modeller ve çok kullanıcılı servisler için uygundur.

Hangi Runtime Ne Zaman Tercih Edilmeli?

Jetson platformlarında aynı model farklı çıkarım motorları (runtime) kullanılarak çalıştırılabilir. Ancak her runtime farklı kullanım senaryolarına odaklandığından, doğru seçimin yapılması performans ve kullanım kolaylığı açısından önemlidir.

Runtime Öne Çıktığı Senaryo Avantajı
vLLM En yüksek performans Yüksek throughput sağlar ve Jetson’da en geniş model desteğine sahiptir.
SGLang Çok kullanıcılı sunucular Yüksek concurrency için optimize edilmiştir.
Ollama Hızlı kurulum Kurulumu ve model yönetimi oldukça kolaydır.
llama.cpp Hafif sistemler Düşük kaynak tüketimiyle CPU ve GPU üzerinde çalışabilir.

Sonuç

Jetson platformları, günümüzde yalnızca küçük yapay zekâ modellerini çalıştıran geliştirme kartları olmaktan çıkmış; büyük dil modelleri (LLM) ve görsel-dil modellerini (VLM) yerel olarak çalıştırabilen güçlü edge yapay zekâ platformlarına dönüşmüştür. Özellikle nicemleme (quantization) teknikleri ve modern çıkarım motorları sayesinde, daha önce yalnızca veri merkezlerinde çalıştırılabilen birçok model artık tek bir Jetson cihazı üzerinde gerçek zamanlı olarak kullanılabilmektedir.

Bu yazıda, Jetson AI Lab tarafından desteklenen modellerin cihazlara göre uyumluluğu, farklı runtime seçenekleri ve Spark Arena benchmark sonuçları birlikte incelenmiştir. Bu bilgiler, belirli bir Jetson platformu için uygun modeli seçerken yalnızca model boyutunu değil, aynı zamanda çıkarım motorunu, nicemleme yöntemini ve hedef performansı da dikkate almanın önemini göstermektedir.

Jetson ekosistemi sürekli gelişmeye devam ettiğinden, desteklenen model sayısı ve performans sonuçları zaman içerisinde değişebilir. Bu nedenle uygulama geliştirme sürecinde Jetson AI Lab ve Spark Arena gibi güncel kaynakların takip edilmesi, en uygun model ve yapılandırmanın seçilmesine yardımcı olacaktır.

OPENZEKA HABERLERİ

Abone olmak ister misiniz?

Hemen ilgilendiğiniz alanları seçerek bültenimizden haberdar olabilirsiniz.

Kategoriler

OPENZEKA HABERLERİ

Abone olmak ister misiniz?

Hemen ilgilendiğiniz alanları seçerek bültenimizden haberdar olabilirsiniz.

Kategoriler

Hesaplarınızda paylaşmak ister misiniz?

İlgili Yazılar