Bir robotun akşam yemeğinden sonra masayı toplaması için bugüne kadar üç ayrı model gerekiyordu. Sahneyi anlayıp plan çıkaran bir görsel-dil modeli (VLM), o planı motor komutlarına çeviren bir eylem modeli (VLA) ve “Bu hareketi yaparsam ne olur?” sorusunu yanıtlayan bir dünya modeli.
Üç model demek, üç ayrı çıkarım servisi, üç ayrı bellek bütçesi ve aralarında senkronizasyon derdi demek. Uç cihazda çalışıyorsanız bu yük katlanarak artıyor.
NVIDIA’nın 31 Mayıs 2026’da yayınladığı Cosmos 3, bu üç işi tek modelde topluyor, hem de mimari değişiklik gerektirmeden. Model ailesi 4 milyardan 64 milyar parametreye kadar üç boyutta geliyor ve en küçüğü Jetson üzerinde çalışacak şekilde tasarlanmış.
Omnimodal Ne Demek?
Cosmos 3’ün girdileri metin, görüntü, video, ses ve eylem.
Çıktıları da aynı beş modalite. Bu esneklik, modelin duruma göre farklı rollere bürünmesini sağlıyor:
- Girdi: Metin / Görüntü / Video
Çıktı: Video
Video üretimi - Girdi: Metin / Video
Çıktı: Metin
Görsel-dil modeli (VLM) - Girdi: Eylem + Görüntü + Metin
Çıktı: Video
İleri dinamik modeli - Girdi: Metin / Video
Çıktı: Eylem
Ters dinamik modeli - Girdi: Görüntü + Metin
Çıktı: Video ve Eylem
Son satır özellikle önemli:
Model hem yapacağı hareketi hem de o hareketin sonucunda ortaya çıkacak görüntüyü aynı anda üretiyor. Yani robot, “elimi buraya götürürsem sahne şöyle görünecek” öngörüsünü kendi içinde kurabiliyor.
Mimari: İki Kule, Tek Dikkat
Cosmos 3’ün temelindeki fikre Mixture-of-Transformers (MoT) deniyor. Her transformer katmanında birbirinden bağımsız iki parametre seti bulunuyor:
Reasoner kulesi, metin ve anlama token’larını işliyor. Otoregresif çalışıyor, yani token’ları soldan sağa tek tek üretiyor, klasik dil modeli mantığı.
Generator kulesi, görüntü, video, ses ve eylem üretiyor. Difüzyon mantığıyla çalışıyor: 189 video karesi sırayla değil, gürültüden arındırılarak hep birlikte netleşiyor.
İki kulenin kendi LayerNorm katmanları, kendi attention projeksiyonları ve kendi FFN’leri var. Buluştukları tek yer paylaşılan attention operatörü. Burada kural asimetrik:
- Üretim token’ları metin token’larına bakabiliyor, böylece üretilen video verilen prompta ve çıkarılan plana koşullanıyor.
- Metin token’ları üretim token’larına bakamıyor, bakabilseydi “ileriyi görmüş” olur ve otoregresif üretim mantığı bozulurdu.
Bu tasarımın pratik sonucu şu: 8 milyar parametrelik bir omurga, kule ikiye katlandığı için 16 milyar parametrelik bir modele dönüşüyor. Cosmos3-Nano’nun “16B” etiketi buradan geliyor.
Kodlayıcılar
Model ham piksel veya ses dalgasıyla doğrudan çalışamıyor; her modalitenin bir çevirmene ihtiyacı var:
- Görsel anlama için ViT (16×16 yama, 2×2 token birleştirme). Omurgayla birlikte eğitiliyor.
- Görsel üretim için video VAE: zamanda 4×, uzayda 32×32 sıkıştırma. Eğitim boyunca donuk tutuluyor.
- Ses için 48 kHz stereo VAE, saniyede 25 token üretiyor.
- Eylem için gövde tipine özel doğrusal projeksiyonlar.
Eylem Temsili
Robotik tarafında ilginç bir tasarım kararı var. Her robotun eklem yapısı, PID ayarları ve motor karakteristiği farklı; bunları doğrudan öğretmek modeli tek bir gövdeye hapseder.
Bunun yerine Cosmos 3, komutu değil sonucu kaydediyor, “4 numaralı motora şu kadar akım verdim” yerine “robotun eli şu kadar ilerledi ve şu kadar döndü.” şeklinde. Dolayısıyla bir koldan öğrenilen bilgi insansı robotlara aktarılabiliyor.
Üç Model
- Sürüm: Cosmos3-Edge — Toplam: 4B — Omurga: Sıfırdan eğitilmiş — Hedef donanım: Jetson Thor, AGX Orin, DGX Spark
- Sürüm: Cosmos3-Nano — Toplam: 16B — Omurga: Qwen3-VL-8B — Hedef donanım: RTX PRO 6000 Blackwell (96 GB)
- Sürüm: Cosmos3-Super — Toplam: 64B — Omurga: Qwen3-VL-32B — Hedef donanım: 8× H200 / H100 / A100
Nano ve Super modelleri aynı mimariye sahipken Edge modelinde durum farklı. Edge, diğer ikisinin aksine hazır bir modelden başlatılmamış. Megatron ile sıfırdan eğitilmiş. Tasarımı Qwen3-1.7B’ye benziyor ama QK normalizasyonu kaldırılmış ve FFN aktivasyonu olarak ReLU-kare kullanılmış.
Edge ayrıca sadece küçültülmüş bir Nano değil. Ses modalitesi tamamen çıkarılmış, video girdisi desteklenmiyor, çözünürlük 480p ile sınırlı ve kare sayısı 50–150 aralığında.
Buna karşılık Edge’in reasoner tarafında “thinking” varsayılan olarak açık. Aynı göreve Nano dört cümlelik bir plan verirken Edge önce uzun bir düşünme zinciri kurup sonra adım adım plan çıkarıyor.
Küçük model, daha çok düşünerek telafi ediyor.
Performans: Hangi Donanımda Ne Alıyorsunuz?
NVIDIA, GitHub deposunda oldukça şeffaf performans ölçümleri yayınladı. Aşağıdaki sonuçlar 189 kare, 720p metin-video üretimi için gereken süreyi saniye cinsinden gösteriyor:
- H200 NVL ×1
Cosmos3-Nano: 240 sn | Cosmos3-Super: 911 sn - H200 NVL ×8
Cosmos3-Nano: 39 sn | Cosmos3-Super: 124 sn - B200 ×1
Cosmos3-Nano: 108 sn | Cosmos3-Super: 390 sn - B200 ×8
Cosmos3-Nano: 23 sn | Cosmos3-Super: 62 sn - RTX PRO 6000 Blackwell ×1
Cosmos3-Nano: 370 sn | Cosmos3-Super: Test verisi yok
Çözünürlüğü 480p’ye düşürmek maliyeti yaklaşık 3,5 kat azaltıyor. NVIDIA’nın image-to-video post-training süreci de zaten 480p ve 189 kare üretim için özelleştirilmiş.
Reasoner tarafındaki fark ise daha da belirleyici. RTX PRO 6000 Blackwell üzerinde tek akışta:
- İlk token gecikmesi
Nano: 188 ms | Super: 535 ms - Üretim hızı
Nano: 71 token/sn | Super: 19 token/sn
Bellek Matematiği
BF16 formatında her parametre yaklaşık 2 bayt yer kaplıyor:
- Edge (4B)
Ağırlık boyutu: 8 GB - Nano (16B)
Ağırlık boyutu: 32 GB - Super (65B)
Ağırlık boyutu: 130 GB
Bunlara ek olarak KV cache, aktivasyonlar ve video üretim tamponları da bellekte yer kaplıyor. NVIDIA’nın Nano için 96 GB RTX PRO 6000 Blackwell önermesinin sebebi model ağırlıklarının 96 GB tutması değil; üretim sırasında gereken ek çalışma alanına yer bırakmak.
Super için tek GPU önerisi bulunmuyor. 130 GB ağırlık teorik olarak H200’ün 141 GB belleğine sığabilir, ancak bu durumda KV cache, aktivasyonlar ve üretim tamponları için neredeyse hiç çalışma alanı kalmaz.
Bu nedenle Super için minimum yapılandırma 2×H200, önerilen yapılandırma ise 8×H200.
DGX Spark sahipleri için önemli bir not: 128 GB birleşik bellek, Nano’nun yaklaşık 32 GB’lık ağırlıklarını rahatlıkla barındırabilir. Ancak NVIDIA’nın resmî test donanım listesinde Nano için GB200 ve H100 yer alırken, DGX Spark yalnızca Edge’in test listesinde geçiyor.
Bu nedenle DGX Spark üzerinde Nano çalıştırmayı planlıyorsanız kendi performans ve bellek ölçümlerinizi yapmakta fayda var.
Benchmark Sonuçları
Modelin en dikkat çekici sonuçlarından biri sürüş alanında görülüyor:
- Cosmos3-Super
Sürüş akıl yürütme skoru: 79,3 - Cosmos3-Nano
Sürüş akıl yürütme skoru: 76,0 - Gemini 3.1 Pro (kapalı)
Sürüş akıl yürütme skoru: 47,2 - Qwen3-VL-32B
Sürüş akıl yürütme skoru: 40,7 - Qwen3-VL-8B
Sürüş akıl yürütme skoru: 46,4
Nano, kendi omurgası olan Qwen3-VL-8B’yi yaklaşık 30 puan geride bırakıyor. Bu farkın temel kaynağı, SFT aşamasında yapılan domain-specific training.
Fizik anlayışı tarafında ise Google DeepMind’ın Physics-IQ testi bağımsız bir doğrulama sunuyor. Aşağıdaki sonuçlar image-to-video performansını gösteriyor:
- Cosmos3-Super-Image2Video
Physics-IQ: 39,5 - Grok Imagine Video
Physics-IQ: 34,8 - Hunyuan Video 1.5
Physics-IQ: 33,4 - Wan 2.2
Physics-IQ: 32,2 - Cosmos3-Nano
Physics-IQ: 30,3 - Sora 2
Physics-IQ: 26,5
Buradaki önemli nokta şu: Video üretim kalitesinde Nano ile Super arasında neredeyse hiç fark yok.
- Text-to-video: Nano 79,4 | Super 80,0
- Image-to-video: Nano 82,7 | Super 82,8
Yani yaklaşık 4 kat daha fazla parametre, doğrudan video kalitesinde belirgin bir kazanç sağlamıyor.
Super’in asıl üstünlüğü fiziksel doğruluk, akıl yürütme ve görüntü içine okunabilir metin yazabilme gibi alanlarda ortaya çıkıyor.
Nasıl çalıştırılır?
Donanım almadan önce görmek istiyorsanız build.nvidia.com üzerinden tarayıcıda deneyebilirsiniz. Kendi sisteminizde çalıştırmak için en kısa yol Diffusers:
Hangi Sürümü Seçmeli?
- Robot üstü, gerçek zamanlı çıkarım
Seçim: Edge
Gerekçe: Jetson üzerinde çalışan tek sürüm. - Robot politikası eğitimi
Seçim: Nano
Gerekçe: Policy-DROID türevi Nano ve Edge tabanında mevcut. - Büyük ölçekli sentetik veri üretimi
Seçim: Super
Gerekçe: Fizik doğruluğu ve metin render avantajı büyük ölçekte daha anlamlı hale geliyor. - Sadece kaliteli görüntü / video üretimi
Seçim: 4Step damıtmaları
Gerekçe: Yaklaşık 25 kat daha hızlı, kalite kaybı ise ihmal edilebilir seviyede. - Tek iş istasyonu, karma kullanım
Seçim: Nano
Gerekçe: 32 GB ağırlık boyutu ve 71 token/sn üretim hızıyla dengeli bir seçenek.
Kısaca: Edge uç cihazlar için, Nano genel kullanım ve tek sistem dengesi için, Super ise maksimum doğruluk ve büyük ölçekli üretim için konumlanıyor.
Lisans ve Erişim
Cosmos 3 modelleri OpenMDW-1.1 lisansıyla yayınlanıyor. Bu Linux Foundation’ın açık model lisansı; ticari kullanıma, türev model üretmeye ve dağıtmaya izin veriyor.
Yayınla birlikte beş sentetik veri seti (fizik etkileşimleri, robot sahneleri, sürüş senaryoları, dijital insan, depo operasyonları) ve Cosmos-HUE insan değerlendirme benchmark’ı da açık lisansla paylaşıldı.
Post-training tarifleri NVIDIA/cosmos-framework deposunda mevcut. Kendi verinizle ince ayar yapmak için mimari değişikliği gerekmiyor.
Sonuç
Cosmos 3’ün asıl katkısı benchmark skorları değil, birleştirme. Üç ayrı modelin yerini tek bir model aldığında entegrasyon yükünün büyük kısmı ortadan kalkıyor — ki uç cihazda çalışan bir robotik sistem için bu, birkaç puanlık benchmark farkından çok daha değerli.
Edge sürümünün diğer ikisinin toplamından dört kat fazla indirilmiş olması bu tezi destekliyor. Fiziksel yapay zekânın gerçek sınavı veri merkezinde değil, sahada veriliyor.
OPENZEKA HABERLERİ
OPENZEKA HABERLERİ
Hesaplarınızda paylaşmak ister misiniz?




