VLM Çıkarım Benchmark Gezgini

Qwen3-VL-4B-Instruct, RTX PRO 6000 üzerinde — Q8_0, llama.cpp görüntü-dil çıkarım benchmark'ı

Bu yapılandırmayı VLM Çıkarım Benchmark Gezgini'nde açın

ModelQwen3-VL-4B-Instruct
Parametre4.4B
CihazRTX PRO 6000
KuantizasyonQ8_0
Görüntü boyutu720p
Kamera başına görüntü1
Maks. kamera (yanıt ≤ 3 sn)16+
Inference Enginellama.cpp
KameraYanıt (sn)TPS (tok/s)Durum
10.25231.4PASS
20.27161.1PASS
40.44140.0PASS
80.7099.8PASS
161.0973.3PASS

Qwen3-VL-4B-Instruct (4,4B parametre), Q8_0 biçiminde llama.cpp ile RTX PRO 6000 üzerinde sunuldu; bir 720p görüntü gönderen tek bir kameraya 0,25 sn sonra yanıt vermeye başlar, ardından 231,4 tok/s hızla yazar.

Kamera başına 720p boyutunda 5 görüntüyle yanıt 0,76 sn sonra başlar. Tek bir 2K görüntüyle 0,94 sn sonra.

Yanıtın 3 sn içinde başlaması varsayılan hedefinde (720p, kamera başına bir görüntü) aynı anda en az 16 kameraya yetişir: ölçülen en yüksek kamera sayısında bile hedefi karşıladı, gerçek sınır daha yüksektir.