LLM Çıkarım Benchmark Gezgini

8× DGX Spark üzerinde DeepSeek V4 Flash 0731 — NVFP4, vLLM, TP2, DP4 çıkarım benchmark'ı

Bu yapılandırmayı LLM Çıkarım Benchmark Gezgini'nde aç

ModelDeepSeek V4 Flash 0731
Parametre304B
Zekâ Endeksi34.3
Agentic Endeksi41
Cihaz8× DGX Spark
KuantizasyonNVFP4
Maks C16
Chat Kapasitesi64
Agentic Kapasitesi24
TP2
DP4
PP—
Inference EnginevLLM
Spekülatif Kod Çözme—
CTTFT (ms)TPS (tok/s)Durum
128948.86PASS
232643.12PASS
434638.47PASS
841129.85PASS
1652323.37PASS
3265316.44FAIL
6493910.71FAIL

OpenZeka'nın ölçümünde, 8× DGX Spark üzerinde vLLM ile NVFP4 formatında sunulan DeepSeek V4 Flash 0731 (304B parametre, TP=2, DP=4), tek istekte istek başına 48,9 tok/s üretim hızına ve 289 ms ilk token süresine (TTFT) ulaştı.

Hız hedefleri ve kullanılabilir KV önbelleği kapasitesi göz önünde bulundurulduğunda, tahmini kapasite chat kullanımı için 64, agentic kullanım için 24 kullanıcıdır. Gerçekçi kapasite muhtemelen bu iki değer arasında olacaktır. Kodlama, araç kullanımı, uzun iş akışları ve çoklu ajan kullanımının ağırlıklı olduğu senaryolarda kapasite agentic tahmine yaklaşırken; daha kısa etkileşimlerin, standart sohbetlerin ve daha hafif görevlerin ağırlıkta olduğu kullanımlarda chat tahminine yaklaşacaktır.

Notlar: TP=2, DP=4. Best for high concurrency.

Zekâ Endeksi ve Agentic Endeksi değerleri Artificial Analysis tarafından yayımlanmıştır ve kaynak belirtilerek burada aktarılmıştır.