Wijzigingslogboek
Nieuwe whitepapers en nieuwe LLM- en CV-benchmarkresultaten, van nieuw naar oud. Elke vermelding linkt naar waar zij over gaat.
oktober 2026
- 1 oktoberNieuwe LLM-benchmarkGemma-4-31B-it — ThorGemma-4-31B-it op Jetson AGX Thor: NVFP4-gewichten geserveerd met vLLM, met MTP voor speculatieve decodering (k=3) en een context van 256K.
- 1 oktoberNieuwe LLM-benchmarkQwen3-VL-30B-A3B-Instruct — ThorQwen3-VL-30B-A3B-Instruct, een vision-languagemodel, op Jetson AGX Thor: FP8-gewichten geserveerd met vLLM, met speculatieve decodering en een context van 256K.
- 1 oktoberNieuwe LLM-benchmarkQwen3.8-27B — RTX PRO 6000Qwen3.8-27B op één RTX PRO 6000: FP8-gewichten geserveerd met vLLM, met MTP voor speculatieve decodering (k=3), gemeten tot 128 gelijktijdige verzoeken.
- 1 oktoberNieuwe LLM-benchmarkMiMo-V2.6-Pro-MOPD — DGX B300MiMo-V2.6-Pro-MOPD (1.02T) op DGX B300: FP4-gewichten geserveerd met vLLM op vier GPU's (TP4), met DFlash speculatieve decodering (k=7) en een context van 1M tokens, gemeten tot 256 gelijktijdige verzoeken.
- 1 oktoberNieuwe LLM-benchmarkMiMo-V2.6-Flash-RL — 2× DGX SparkMiMo-V2.6-Flash-RL (310B) op 2× DGX Spark: FP4-gewichten geserveerd met vLLM over beide nodes (TP2), met DFlash speculatieve decodering (k=7) en een context van 256K.
- 1 oktoberNieuwe LLM-benchmarkMiMo-V2.6-Flash-RL — 4× DGX SparkMiMo-V2.6-Flash-RL (310B) op 4× DGX Spark: FP4-gewichten geserveerd met vLLM over vier nodes (TP4), met DFlash speculatieve decodering (k=7) en een context van 500K.
september 2026
- 29 septemberNieuwe whitepaperEngram-offloading bij LLM-inferentieEngram-tabellen zijn groot, maar per token worden er maar een paar rijen uit gelezen; daarom kunnen ze van het GPU-geheugen naar systeem-RAM of NVMe. Wat dat betekent op DGX Spark, RTX PRO 6000 en DGX B300, en meetresultaten met DeepSeek-V4.1-Flash en Qwen3.8-Flash-Next.
- 28 septemberNieuwe LLM-benchmarkQwen3.8-Flash-Next — 1× DGX SparkQwen3.8-Flash-Next (176B) op één DGX Spark: NVFP4-gewichten geserveerd met SGLang, met MTP voor speculatieve decodering (k=3) en de n-gram-embeddingtabel van 47.7 GiB gelezen vanaf NVMe.
- 28 septemberNieuwe LLM-benchmarkQwen3.8-Flash-Next — RTX PRO 6000Qwen3.8-Flash-Next (176B) op één RTX PRO 6000: NVFP4-gewichten geserveerd met SGLang, met MTP voor speculatieve decodering (k=3) en de n-gram-embeddingtabel van 47.7 GiB in systeem-RAM.
- 28 septemberNieuwe LLM-benchmarkMiMo-V2.6-Pro-RL — DGX B300MiMo-V2.6-Pro-RL (1.02T) op DGX B300: FP4-gewichten geserveerd met vLLM op vier GPU's (TP4), met DFlash speculatieve decodering (k=7) en een context van 1M tokens.
- 18 septemberNieuwe CV-benchmarkPeopleNet INT8 — Jetson AGX ThorPeopleNet-persoonsdetectie (INT8, invoer 960×544) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
- 18 septemberNieuwe CV-benchmarkYOLO11-N — Jetson AGX ThorYOLO11-N-objectdetectie (invoer 640×640) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 30 gelijktijdige camera's.
- 18 septemberNieuwe CV-benchmarkYOLO11S — Jetson AGX ThorYOLO11S-objectdetectie (invoer 640×640) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
- 18 septemberNieuwe CV-benchmarkYOLO11M — Jetson AGX ThorYOLO11M-objectdetectie (invoer 640×640) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
- 18 septemberNieuwe CV-benchmarkYOLO11L — Jetson AGX ThorYOLO11L-objectdetectie (invoer 640×640) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
- 17 septemberNieuwe whitepaperDeepSeek-V4.1-Flash-deployment op 8× DGX Spark met TP8Deployment van DeepSeek-V4.1-Flash (763B MoE, FP8, DSpark k=5) op 8× NVIDIA DGX Spark (GB10) met TP8: twee configuraties (300K met Engram in het geheugen, 1M met Engram-on-disk), NCCL-optimalisatie, benchmarkresultaten en vergelijking met TP4.
- 17 septemberNieuwe LLM-benchmarkDeepSeek-V4.1-Flash — 8× DGX SparkDeepSeek-V4.1-Flash (763B) op 8× DGX Spark: FP8-gewichten geserveerd met vLLM over acht nodes (TP8), met DSpark speculatieve decodering (k=5) en een context van 300K, de Engram-tabel in het geheugen.
- 17 septemberNieuwe LLM-benchmarkDeepSeek-V4.1-Flash — 8× DGX SparkDeepSeek-V4.1-Flash (763B) op 8× DGX Spark: dezelfde TP8-opstelling met een context van 1M tokens, de Engram-tabel verplaatst naar schijf.
- 16 septemberNieuwe whitepaperDeepSeek-V4.1-Flash-deployment op 4× DGX SparkDeployment van DeepSeek-V4.1-Flash (763B MoE, FP8, DSpark k=5) op 4× NVIDIA DGX Spark (GB10) met tensorparallellisme: vLLM-buildketen, 7 patches voor SM 12.1a, Engram-on-disk, benchmarkresultaten en vergelijking met B300.
- 16 septemberNieuwe LLM-benchmarkDeepSeek-V4.1-Flash — 4× DGX SparkDeepSeek-V4.1-Flash (763B) op 4× DGX Spark: FP8-gewichten geserveerd met vLLM over vier nodes (TP4), met DSpark speculatieve decodering (k=5) en een context van 300K.
- 16 septemberNieuwe CV-benchmarkPeopleNet INT8 — GB10PeopleNet-persoonsdetectie (INT8, invoer 960×544) op GB10 (DGX Spark): frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
- 16 septemberNieuwe CV-benchmarkPeopleNet INT8 — Jetson Orin NanoPeopleNet-persoonsdetectie (INT8, invoer 960×544) op Jetson Orin Nano: frames per seconde per camera, gemeten van 1 tot 8 gelijktijdige camera's.
- 16 septemberNieuwe CV-benchmarkPeopleNet INT8 — RTX 3060PeopleNet-persoonsdetectie (INT8, invoer 960×544) op RTX 3060: frames per seconde per camera, gemeten van 1 tot 16 gelijktijdige camera's.
- 16 septemberNieuwe CV-benchmarkPeopleNet INT8 — RTX 3090PeopleNet-persoonsdetectie (INT8, invoer 960×544) op RTX 3090: frames per seconde per camera, gemeten van 1 tot 30 gelijktijdige camera's.
- 16 septemberNieuwe CV-benchmarkYOLO11-N — RTX 3090YOLO11-N-objectdetectie (invoer 640×640) op RTX 3090: frames per seconde per camera, gemeten van 1 tot 28 gelijktijdige camera's.
- 14 septemberNieuwe LLM-benchmarkDeepSeek-V4.1-Flash — DGX B300DeepSeek-V4.1-Flash (763B) op DGX B300: FP8-gewichten geserveerd met vLLM op vier GPU's (TP4), met DSpark speculatieve decodering (k=3) en een context van 1M tokens.
- 14 septemberNieuwe LLM-benchmarkTencent-Hy4-preview — DGX B300Tencent-Hy4-preview (780B) op DGX B300: BF16-gewichten geserveerd met vLLM op alle acht GPU's (TP8), met MTP voor speculatieve decodering (k=3) en een context van 512K.
- 14 septemberNieuwe LLM-benchmarkDeepSeek-V4-Flash-Vision-Exp — 2× DGX SparkDeepSeek-V4-Flash-Vision-Exp (305B) op 2× DGX Spark: FP8-gewichten geserveerd met vLLM over beide nodes (TP2), met DSpark speculatieve decodering (k=3) en een context van 131K.
- 4 septemberNieuwe LLM-benchmarkGLM-5.3 — 8× DGX SparkGLM-5.3 (753B) op 8× DGX Spark: NVFP4-gewichten geserveerd met vLLM over acht nodes (TP8), met de ingebouwde MTP van het model voor speculatieve decodering (k=4) en een context van 256K.
- 4 septemberNieuwe LLM-benchmarkMuse-Glimmer-30B — RTX PRO 6000Muse-Glimmer-30B op één RTX PRO 6000: BF16-gewichten geserveerd met vLLM, met DFlash speculatieve decodering via de ingebouwde MTP van het model (k=15).
- 1 septemberNieuwe LLM-benchmarkGLM-5.3 — DGX B300GLM-5.3 (753B) op DGX B300: FP8-gewichten geserveerd met SGLang op vier GPU's (TP4), met een context van 1M tokens.
augustus 2026
- 3 augustusNieuwe whitepaperNVIDIA DGX B300 vs GB300 NVL72: vergelijking van clusterarchitecturenTechnische vergelijking van twee NVIDIA Blackwell Ultra-architecturen, DGX B300 en GB300 NVL72: systeemontwerp, schaalaanpak, netwerkfabric, stroom en koeling, en welke workloads bij welk platform passen.
juli 2026
- 30 juliNieuwe whitepaperKimi K3-inferentiebenchmark op DGX-B300Prestatie-evaluatie van Moonshot AI Kimi K3 (2.8T MoE, MXFP4) op NVIDIA DGX-B300 (8x Blackwell Ultra, TP=8): vLLM versus SGLang, direct versus DSpark speculatieve decodering, met capaciteitsplanning op basis van SLO's.
- 30 juliNieuwe whitepaperInstallatiehandleiding voor een DGX Spark AI-cluster met 3 nodesInstallatie van een AI-cluster in ringtopologie (mesh) met 3 NVIDIA DGX Spark-nodes: management- en compute-netwerk, RoCEv2/RDMA, sparkrun-configuratie.
- 30 juliNieuwe whitepaperInstallatiehandleiding voor een DGX Spark AI-cluster met 2 nodesInstallatie van een AI-cluster in point-to-point-topologie met 2 NVIDIA DGX Spark-nodes: management- en compute-netwerk, RoCEv2/RDMA, sparkrun-configuratie.
- 24 juliNieuwe whitepaperInstallatiehandleiding voor een DGX Spark AI-cluster met 8 nodesInstallatie van een switchgebaseerd AI-cluster met 8 NVIDIA DGX Spark-nodes via een MikroTik CRS804 met 200G-breakout: management- en compute-netwerk, RoCEv2/RDMA, sparkrun en NAS.
- 24 juliNieuwe whitepaperInstallatiehandleiding voor een DGX Spark AI-cluster met 4 nodesInstallatie van een switchgebaseerd AI-cluster met 4 NVIDIA DGX Spark-nodes via een MikroTik CRS812: management- en compute-netwerk, RoCEv2/RDMA, sparkrun en NAS.
- 6 juliNieuwe whitepaperSchaling van Qwen3.6-27B op een DGX Spark-clusterSchalingsstudie over meerdere nodes van Qwen3.6-27B-NVFP4 op 1x, 2x en 4x NVIDIA DGX Spark (GB10): tensorparallellisme over 200GbE, capaciteitsplanning op basis van SLO's en advies voor de keuze tussen TP en replicatie bij deployment.
- 3 juliNieuwe whitepaperQwen3.6-27B DGX Spark-benchmarkPrestatie-evaluatie van het Qwen3.6-27B-model op het NVIDIA DGX Spark (GB10)-platform met de kwantisatievarianten FP8, FP8-MTP, AWQ-MTP, NVFP4 en NVFP4-MTP.
juni 2026
- 30 juniNieuwe whitepaperHandleiding voor lokaal LLM-gebruikIntegrale beslisgids voor lokaal LLM-gebruik: hardware (NVIDIA Jetson, RTX PRO, DGX Spark, DGX/HGX), modelkeuze, softwarestack en koppeling aan scenario's.