VLM Çıkarım Benchmark Gezgini
Bu cihaz bu görüntü-dil modeliyle (vision-language model) kaç kamerayı izleyebilir? Kameralarınızın gönderdiği görüntü boyutunu seçin ve bir kameranın yanıtı için ne kadar bekleyebileceğini belirleyin; tablo, ölçtüğümüz her yapılandırma için güncellenir. Bir satırın her kamera sayısındaki ölçümlerini, sonuçların açıklamasını ve grafiğini görmek için satırı açabilirsiniz.
Benchmark gezgini nasıl kullanılır?
Bir satır ne anlatır
Bir satır tek bir kurulum yapılandırmasıdır: belirli bir donanımda, belirli bir sayı biçiminde, belirli bir engine ile sunulan bir görüntü-dil modeli — baştan sona ölçülmüş hâliyle. Bu yüzden aynı model birkaç satırda görünür; iki satırı doğrudan karşılaştırabilmek için aralarında hangi ayarların farklı olduğunu bilmek gerekir.
Filtreler ve hedef farklı işler görür
Filtreler hangi satırları gördüğünüzü belirler. Cihaz, model, parametre sayısı, kuantizasyon ve engine filtreleri ile yanıt süresi ve kamera kaydırıcıları yalnızca satırları gösterir ya da gizler.
Hedef ve varsayım sayıların ne söylediğini belirler. Bunlar Performans Hedefi ve Varsayımlar altındadır. Birini değiştirdiğinizde satırlar yerinde kalır, ama yanıt süresi, Maks. kamera ve her satırın yeşil ve kırmızı renklendirmesi yeniden hesaplanır.
1. Kameralarınızı tanımlayın
İş yükünü iki seçici tanımlar ve tablodaki her sayı bu seçimlerde okunur:
- Görüntü Boyutu — bir kameranın gönderdiği her görüntünün boyutu: 480p, 720p, 1080p ya da 2K.
- Kamera — aynı anda istek gönderen kamera sayısı. Bu, sistemin ölçüldüğü eşzamanlılıktır (concurrency).
Seçili birleşimde ölçülmemiş satırlar gizlenir; soluk düğmeler ölçümü olmayan birleşimleri gösterir. Birden fazla kamera 480p, 720p ve 1080p’de ölçüldü; 2K yalnızca tek kamerayla.
2. Daraltın ve sıralayın
Filtreler birlikte çalışır ve her sütun sıralanabilir. En öğretici karşılaştırmalar tek bir ayarı değiştirenlerdir: aynı cihazda bir modelin iki kuantizasyonu, aynı modelin llama.cpp ve vLLM ile sunumu ya da bir modelin iki cihazda çalışması.
3. Hedefinizi belirleyin
Hedef, bir kameranın yanıtının başlaması için bekleyebileceği en uzun süredir — varsayılan 3 saniye. Hedefe tam eşit bir yanıt süresi geçer.
Yanındaki Kamera Başına Görüntü, her isteğin kaç görüntü taşıdığını belirler: varsayılan olarak tek bir anlık görüntü ya da aynı kameranın birlikte gönderilen birkaç karesi; video, görüntü-dil modellerine çoğu zaman böyle gönderilir. İstek başına birden fazla görüntü yalnızca tek kamerayla ölçüldü; bu yüzden üç ya da beş görüntüyle Maks. kamera 1’den yüksek olamaz.
4. Maks. kamera değerini okuyun
Maks. kamera, her kameranın yanıtının hedefiniz içinde başladığı en yüksek ölçülmüş kamera sayısıdır. Artı işareti — 16+ — yapılandırmanın test edildiği en yüksek sayıda bile hedefi karşıladığı, yani gerçek üst sınırına ulaşılmadığı anlamına gelir. 0, tek bir kameranın bile zamanında yanıt almadığı demektir.
5. Bir satırı açın
Bir satıra tıkladığınızda şunları görürsünüz:
- solda, görüntü boyutunuzda ve görüntü sayınızda test edilen her kamera sayısının ölçümleri, hedefinize göre BAŞARILI ya da BAŞARISIZ olarak işaretlenmiş;
- sağda, varsayılan ayarlarda sonuçların sade bir dille açıklaması;
- altta, kamera eklendikçe yanıt süresinin grafiği; her görüntü boyutu için bir çizgi, hedefiniz kesikli çizgiyle. Grafik, birden fazla kameranın ölçüldüğü yerde, yani kamera başına bir görüntüyle görünür.
Grafik, rapor ve sunumlar için PNG olarak indirilebilir.
Nereden başlamalı
“Tek bir Jetson AGX Orin kaç kamerayı izleyebilir?” Cihazı seçin, kameralarınızın gönderdiği görüntü boyutunu belirleyin ve Maks. kamera değerini okuyun. Yalnızca yetişen yapılandırmaları görmek için minimum kamera kaydırıcısını ihtiyacınız olan sayıya getirin.
“1080p’ye değer mi?” Görüntü boyutunu değiştirip Maks. kamera değerini izleyin ya da bir satırı açın: grafiğinde her görüntü boyutu için bir çizgi vardır.
“Kuantizasyon ve engine neyi değiştirir?” Modeli ve cihazı sabit tutup yalnızca o ayarda farklılaşan satırları karşılaştırın: Jetson AGX Orin’de Q8_0 ve Q4_K_M ile Qwen3-VL-8B-Instruct ya da RTX PRO 6000’de llama.cpp ve vLLM ile Qwen3-VL-4B-Instruct. Kamera sayısını değiştirmek, farkın yük altında nasıl geliştiğini gösterir.
“Bu donanıma zaten sahibiz; üzerinde ne çalıştırabiliriz?” Cihaz filtresiyle başlayın, kalan modelleri boyuta ya da Maks. kamera değerine göre sıralayın ve ihtiyacınız olan yanıt süresi ya da kamera sayısıyla daraltın.
Sayılar ne anlama gelir ve nasıl hesaplanır?
Sayılar nasıl ölçüldü
Her istek bir ya da daha fazla fotoğraf ve Describe the scene. istemini taşır ve en fazla 128 token ister. Fotoğraflar, istekler arasında sırayla kullanılan ve 854×480 (480p), 1280×720 (720p), 1920×1080 (1080p) ve 2560×1440 (2K) boyutlarına ölçeklenen on altı sabit resimdir; OpenAI uyumlu sohbet API’si üzerinden base64 görüntüler olarak gönderilir. Hugging Face checkpoint’leri vLLM ile, GGUF dosyaları llama.cpp ile sunuldu.
Görüntü boyutu, istek başına görüntü ve kamera sayısının her birleşimi, atılan bir ısınma turundan sonra ayrı ayrı ölçülür. Değerler, tamamlanan isteklerin ortalamasıdır; benchmark sırasında başarısız olan bir istek ortalamaya katılmaz ve yapılandırmanın aleyhine sayılmaz.
- Birden fazla kamera, 480p, 720p ve 1080p’de istek başına bir görüntüyle ölçüldü: Jetson Orin NX’te 1, 2 ve 4 kamera (bir yapılandırmada 8’e kadar), Jetson AGX Orin’de 8’e, RTX PRO 6000’de 16’ya kadar; her seviyede bir Jetson’da 8, RTX PRO 6000’de 24 istek gönderildi ve aynı anda hiçbir zaman seviyedekinden fazla kameranın isteği işlenmedi.
- Tek kamera, dört boyutun hepsinde istek başına bir, üç ve beş görüntüyle, her birinde 5 istekle (bir yapılandırmada 3) ölçüldü. 2K ve istek başına birden fazla görüntü yalnızca bu şekilde ölçüldü.
Token, bir modelin okuduğu ve yazdığı birimdir; kabaca bir İngilizce kelimenin dörtte üçü. Bir görüntü de token olarak okunur ve büyük bir görüntü daha çok token’a dönüşür.
Yanıt süresi
Yanıt süresi, bir kameranın yanıtı başlayana kadar beklediği süredir — ilk token süresi (TTFT, time to first token), saniye cinsinden. Bir görüntü-dil modelinde bu sürenin çoğu görüntüleri okumaktır; bu yüzden görüntülerin boyutu ve sayısıyla, cihazı paylaşan kamera sayısıyla birlikte artar. Boyutla ne kadar arttığı modele bağlıdır: bazıları her görüntüyü sabit sayıda token’a, bazıları piksel arttıkça daha çok token’a dönüştürür. Düşük olması iyidir.
TPS (saniyedeki token), yanıtın ardından kamera başına ne kadar hızlı yazıldığıdır. Görüntüye neredeyse hiç bağlı değildir ve bilgi için gösterilir: Maks. kamera yanıt süresine göre belirlenir. Uzun bir yanıt, yazılma süresini bunun üstüne ekler — saniyede 25 token hızla 128 token yaklaşık beş saniye daha sürer.
Maks. kamera: kamera sayısı eşzamanlılıktır
Bir kamera, önceki isteği yanıtlanır yanıtlanmaz sıradaki isteğini gönderir; yani her zaman tam olarak bir isteği işlenmektedir. Bu yüzden eşzamanlı istek sayısı kamera sayısıdır.
Maks. kamera, yanıt süresinin hedefinizi karşıladığı en yüksek ölçülmüş kamera sayısıdır. Yalnızca ölçülen sayılar sayılır, ara değer üretilmez; hiçbiri geçmezse değer 0’dır. Hedefinize bağlıdır ve onunla birlikte değişir: 720p’de ve kamera başına bir görüntüyle, Jetson AGX Orin üzerindeki Cosmos3-Edge 1 saniyede 2 kameraya, 3 saniyede 8 kameraya — ölçülen en yüksek sayı, yani 8+ — yetişir.
Kurulumu tanımlayan sütunlar
Parametre — görüntü kodlayıcı dahil, modelin yayımlanmış toplam ağırlık sayısı. Mixture-of-experts modellerde bu, her token için etkin olan kısım değil toplamdır; çünkü tamamı bellekte tutulur.
Kuantizasyon — ağırlıkların saklandığı sayı biçimi. BF16 tam hassasiyettir, FP8 8 bit, NVFP4 4 bit kullanır. Q8_0, Q4_K_M ve Q4_0, llama.cpp için ağırlık başına yaklaşık 8 ve 4 bitlik GGUF biçimleridir. Daha az bit, daha az bellek ve genellikle daha çok hız demektir; kalitede bir miktar risk taşır.
Engine — modeli yükleyip istekleri zamanlayan sunucu yazılımı. Hıza donanım kadar etki eder. RTX PRO 6000 üzerinde 720p’de Qwen3-VL-4B-Instruct, tek bir kameraya llama.cpp (Q8_0) ile 0.25 sn, vLLM (BF16) ile 0.16 sn sonra yanıt vermeye başlar; 16 kamerada fark 1.09 sn’ye karşı 0.46 sn’dir.
Cihaz — Jetson Orin NX (16 GB) ve Jetson AGX Orin (32 GB), CPU ile GPU’nun tek bir belleği paylaştığı gömülü modüllerdir; RTX PRO 6000 Blackwell, 96 GB’lık bir iş istasyonu GPU’sudur ve 600 W’lık Workstation ile 300 W’lık Max-Q sürümlerinde ölçüldü.
Sayıların söylemedikleri
Tablo, yapılandırmaların bir saha incelemesi olmadan karşılaştırılabilmesi için tek bir sabit iş yükü — örnek fotoğraflar, kısa bir istem, en fazla 128 tokenlık yanıtlar — ve ortalama değerler kullanır. Kendi kameralarınız ve istemlerinizle yapılacak bir testin yerini tutmaz: farklı görüntü içeriği, daha uzun istemler ya da yanıtlar, farklı engine ayarları ve ortalama yerine en yavaş istekler gerçek kapasiteyi değiştirir. Yanıt süresi, yanıtın başlamasına kadar geçen beklemedir; yanıtın tamamına ihtiyaç duyan bir uygulama yazılma süresini de bekler ve yalnızca tek kamerayla ölçülmüş bir satır, birden fazla kamerayla nasıl davrandığı hakkında bir şey söylemez.
Cosmos-Reason1-7B (8,3B parametre), Q4_K_M biçiminde llama.cpp ile Jetson Orin NX üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 7,68 sn sonra yanıt vermeye başlar, ardından 12 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 37,76 sn sonra başlar. Tek bir 1080p görüntüyle 23,3 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) tek bir kamera bile zamanında yanıt almaz.
Cosmos-Reason2-2B (2,4B parametre), Q8_0 biçiminde llama.cpp ile Jetson Orin NX üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 2,02 sn sonra yanıt vermeye başlar, ardından 30,4 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 9,94 sn sonra başlar. Tek bir 1080p görüntüyle 5,45 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda 2 kameraya yetişir.
Cosmos-Reason2-8B (8,8B parametre), Q4_K_M biçiminde llama.cpp ile Jetson Orin NX üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 6,87 sn sonra yanıt vermeye başlar, ardından 11,6 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 34,19 sn sonra başlar. Tek bir 1080p görüntüyle 21,75 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) tek bir kamera bile zamanında yanıt almaz.
Gemma-4-E2B-it (5,1B parametre), Q4_0 biçiminde llama.cpp ile Jetson Orin NX üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 1,38 sn sonra yanıt vermeye başlar, ardından 29,8 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 6,31 sn sonra başlar. Tek bir 1080p görüntüyle 3,43 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda 2 kameraya yetişir.
Gemma-4-E4B-it (8,0B parametre), Q4_0 biçiminde llama.cpp ile Jetson Orin NX üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 1,86 sn sonra yanıt vermeye başlar, ardından 17,2 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 8,32 sn sonra başlar. Tek bir 1080p görüntüyle 4,45 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) yalnızca tek bir kameraya yetişir.
Qwen3-VL-4B-Instruct (4,4B parametre), FP8 biçiminde vLLM ile Jetson Orin NX üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 1,67 sn sonra yanıt vermeye başlar, ardından 14,2 tok/s hızla yazar.
Kamera başına 720p boyutunda 3 görüntüyle yanıt 4 sn sonra başlar. Tek bir 1080p görüntüyle 4,34 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda 2 kameraya yetişir.
Qwen3-VL-4B-Instruct (4,4B parametre), Q8_0 biçiminde llama.cpp ile Jetson Orin NX üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 3,04 sn sonra yanıt vermeye başlar, ardından 14,3 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 14,62 sn sonra başlar. Tek bir 2K görüntüyle 18,39 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) tek bir kamera bile zamanında yanıt almaz.
Qwen3-VL-8B-Instruct (8,8B parametre), Q4_K_M biçiminde llama.cpp ile Jetson Orin NX üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 6,92 sn sonra yanıt vermeye başlar, ardından 11,4 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 34,43 sn sonra başlar. Tek bir 1080p görüntüyle 21,78 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) tek bir kamera bile zamanında yanıt almaz.
Qwen3.5-4B (4,7B parametre), Q4_K_M biçiminde llama.cpp ile Jetson Orin NX üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 3,72 sn sonra yanıt vermeye başlar, ardından 15,6 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 17,25 sn sonra başlar. Tek bir 1080p görüntüyle 8,48 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) tek bir kamera bile zamanında yanıt almaz.
Cosmos-Reason1-7B (8,3B parametre), Q4_K_M biçiminde llama.cpp ile Jetson AGX Orin üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 3,21 sn sonra yanıt vermeye başlar, ardından 26,7 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 15,84 sn sonra başlar. Tek bir 2K görüntüyle 18,62 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) tek bir kamera bile zamanında yanıt almaz.
Cosmos-Reason2-2B (2,4B parametre), Q8_0 biçiminde llama.cpp ile Jetson AGX Orin üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,95 sn sonra yanıt vermeye başlar, ardından 57,8 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 4,45 sn sonra başlar. Tek bir 2K görüntüyle 7,07 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda 4 kameraya yetişir.
Cosmos-Reason2-8B (8,8B parametre), Q4_K_M biçiminde llama.cpp ile Jetson AGX Orin üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 2,71 sn sonra yanıt vermeye başlar, ardından 25,4 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 13,21 sn sonra başlar. Tek bir 2K görüntüyle 20,51 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) yalnızca tek bir kameraya yetişir.
Cosmos3-Edge (3,9B parametre), BF16 biçiminde vLLM ile Jetson AGX Orin üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,51 sn sonra yanıt vermeye başlar, ardından 45,6 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 2,11 sn sonra başlar. Tek bir 2K görüntüyle 2,71 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 8 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Gemma-4-26B-A4B-it (26B parametre), Q4_0 biçiminde llama.cpp ile Jetson AGX Orin üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 2,34 sn sonra yanıt vermeye başlar, ardından 32,7 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 10,78 sn sonra başlar. Tek bir 2K görüntüyle 9,94 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda 2 kameraya yetişir.
Gemma-4-E4B-it (8,0B parametre), Q4_0 biçiminde llama.cpp ile Jetson AGX Orin üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,86 sn sonra yanıt vermeye başlar, ardından 34,2 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 3,58 sn sonra başlar. Tek bir 2K görüntüyle 2,55 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda 4 kameraya yetişir.
Qwen3-VL-4B-Instruct (4,4B parametre), Q8_0 biçiminde llama.cpp ile Jetson AGX Orin üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 1,31 sn sonra yanıt vermeye başlar, ardından 28,4 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 6,4 sn sonra başlar. Tek bir 2K görüntüyle 8,32 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda 2 kameraya yetişir.
Qwen3-VL-8B-Instruct (8,8B parametre), Q4_K_M biçiminde llama.cpp ile Jetson AGX Orin üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 2,75 sn sonra yanıt vermeye başlar, ardından 25,2 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 13,24 sn sonra başlar. Tek bir 2K görüntüyle 20,61 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) yalnızca tek bir kameraya yetişir.
Qwen3-VL-8B-Instruct (8,8B parametre), Q8_0 biçiminde llama.cpp ile Jetson AGX Orin üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 2,64 sn sonra yanıt vermeye başlar, ardından 19,1 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 13,19 sn sonra başlar. Tek bir 2K görüntüyle 20,48 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) yalnızca tek bir kameraya yetişir.
Qwen3.5-4B (4,7B parametre), Q4_K_M biçiminde llama.cpp ile Jetson AGX Orin üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 1,57 sn sonra yanıt vermeye başlar, ardından 33,6 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 7,14 sn sonra başlar. Tek bir 2K görüntüyle 9,04 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda 2 kameraya yetişir.
Cosmos3-Edge (3,9B parametre), BF16 biçiminde vLLM ile RTX PRO 6000 Max-Q üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,09 sn sonra yanıt vermeye başlar, ardından 310,3 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,34 sn sonra başlar. Tek bir 2K görüntüyle 0,43 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Cosmos3-Nano (16B parametre), BF16 biçiminde vLLM ile RTX PRO 6000 Max-Q üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,14 sn sonra yanıt vermeye başlar, ardından 88 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,74 sn sonra başlar. Tek bir 2K görüntüyle 0,75 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Cosmos-Reason1-7B (8,3B parametre), BF16 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,25 sn sonra yanıt vermeye başlar, ardından 98,2 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,71 sn sonra başlar. Tek bir 2K görüntüyle 0,61 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Cosmos-Reason2-2B (2,4B parametre), BF16 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,11 sn sonra yanıt vermeye başlar, ardından 318,3 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,56 sn sonra başlar. Tek bir 2K görüntüyle 0,5 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Cosmos-Reason2-8B (8,8B parametre), BF16 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,15 sn sonra yanıt vermeye başlar, ardından 92,5 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,75 sn sonra başlar. Tek bir 2K görüntüyle 0,68 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Eagle2.5-8B (8,1B parametre), BF16 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,26 sn sonra yanıt vermeye başlar, ardından 105 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 1,35 sn sonra başlar. Tek bir 2K görüntüyle 0,42 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Gemma-4-31B-it (31B parametre), BF16 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,24 sn sonra yanıt vermeye başlar, ardından 24,7 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,7 sn sonra başlar. Tek bir 2K görüntüyle 0,32 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Gemma-4-31B-it (31B parametre), NVFP4 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,27 sn sonra yanıt vermeye başlar, ardından 45,1 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,58 sn sonra başlar. Tek bir 2K görüntüyle 0,3 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Llama-3.1-Nemotron-Nano-VL-8B (8,7B parametre), BF16 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,29 sn sonra yanıt vermeye başlar, ardından 94,9 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 1,79 sn sonra başlar. Tek bir 2K görüntüyle 0,49 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
MedGemma-1.5-4B-it (4,3B parametre), BF16 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,2 sn sonra yanıt vermeye başlar, ardından 171,5 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,45 sn sonra başlar. Tek bir 2K görüntüyle 0,25 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Nemotron-Nano-12B-v2-VL (13B parametre), BF16 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,2 sn sonra yanıt vermeye başlar, ardından 68,5 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,78 sn sonra başlar. Tek bir 2K görüntüyle 0,61 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Qwen3-VL-30B-A3B-Instruct (30B parametre), FP8 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,16 sn sonra yanıt vermeye başlar, ardından 194,4 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 1,04 sn sonra başlar. Tek bir 2K görüntüyle 0,58 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Qwen3-VL-4B-Instruct (4,4B parametre), BF16 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,16 sn sonra yanıt vermeye başlar, ardından 156,6 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,64 sn sonra başlar. Tek bir 2K görüntüyle 0,56 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Qwen3-VL-4B-Instruct (4,4B parametre), Q8_0 biçiminde llama.cpp ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,25 sn sonra yanıt vermeye başlar, ardından 231,4 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,76 sn sonra başlar. Tek bir 2K görüntüyle 0,94 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Qwen3-VL-8B-Instruct (8,8B parametre), BF16 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,23 sn sonra yanıt vermeye başlar, ardından 92,4 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,76 sn sonra başlar. Tek bir 2K görüntüyle 0,68 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Qwen3-VL-8B-Instruct (8,8B parametre), Q8_0 biçiminde llama.cpp ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,33 sn sonra yanıt vermeye başlar, ardından 153,8 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 1,04 sn sonra başlar. Tek bir 2K görüntüyle 1,79 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Qwen3.6-35B-A3B (35B parametre), FP8 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,21 sn sonra yanıt vermeye başlar, ardından 220,8 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,84 sn sonra başlar. Tek bir 2K görüntüyle 0,59 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Qwen3.6-35B-A3B (35B parametre), NVFP4 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,22 sn sonra yanıt vermeye başlar, ardından 282,9 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,84 sn sonra başlar. Tek bir 2K görüntüyle 0,8 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.
Qwen3.8-27B (27B parametre), FP8 biçiminde vLLM ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,29 sn sonra yanıt vermeye başlar, ardından 50 tok/s hızla yazar.
Kamera başına 720p boyutunda 5 görüntüyle yanıt 1,01 sn sonra başlar. Tek bir 2K görüntüyle 0,91 sn sonra.
Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.