Wijzigingslogboek

Nieuwe whitepapers en nieuwe LLM- en CV-benchmarkresultaten, van nieuw naar oud. Elke vermelding linkt naar waar zij over gaat.

oktober 2026

  1. 1 oktoberNieuwe LLM-benchmarkGemma-4-31B-it — ThorGemma-4-31B-it op Jetson AGX Thor: NVFP4-gewichten geserveerd met vLLM, met MTP voor speculatieve decodering (k=3) en een context van 256K.
  2. 1 oktoberNieuwe LLM-benchmarkQwen3-VL-30B-A3B-Instruct — ThorQwen3-VL-30B-A3B-Instruct, een vision-languagemodel, op Jetson AGX Thor: FP8-gewichten geserveerd met vLLM, met speculatieve decodering en een context van 256K.
  3. 1 oktoberNieuwe LLM-benchmarkQwen3.8-27B — RTX PRO 6000Qwen3.8-27B op één RTX PRO 6000: FP8-gewichten geserveerd met vLLM, met MTP voor speculatieve decodering (k=3), gemeten tot 128 gelijktijdige verzoeken.
  4. 1 oktoberNieuwe LLM-benchmarkMiMo-V2.6-Pro-MOPD — DGX B300MiMo-V2.6-Pro-MOPD (1.02T) op DGX B300: FP4-gewichten geserveerd met vLLM op vier GPU's (TP4), met DFlash speculatieve decodering (k=7) en een context van 1M tokens, gemeten tot 256 gelijktijdige verzoeken.
  5. 1 oktoberNieuwe LLM-benchmarkMiMo-V2.6-Flash-RL — 2× DGX SparkMiMo-V2.6-Flash-RL (310B) op 2× DGX Spark: FP4-gewichten geserveerd met vLLM over beide nodes (TP2), met DFlash speculatieve decodering (k=7) en een context van 256K.
  6. 1 oktoberNieuwe LLM-benchmarkMiMo-V2.6-Flash-RL — 4× DGX SparkMiMo-V2.6-Flash-RL (310B) op 4× DGX Spark: FP4-gewichten geserveerd met vLLM over vier nodes (TP4), met DFlash speculatieve decodering (k=7) en een context van 500K.

september 2026

  1. 29 septemberNieuwe whitepaperEngram-offloading bij LLM-inferentieEngram-tabellen zijn groot, maar per token worden er maar een paar rijen uit gelezen; daarom kunnen ze van het GPU-geheugen naar systeem-RAM of NVMe. Wat dat betekent op DGX Spark, RTX PRO 6000 en DGX B300, en meetresultaten met DeepSeek-V4.1-Flash en Qwen3.8-Flash-Next.
  2. 28 septemberNieuwe LLM-benchmarkQwen3.8-Flash-Next — 1× DGX SparkQwen3.8-Flash-Next (176B) op één DGX Spark: NVFP4-gewichten geserveerd met SGLang, met MTP voor speculatieve decodering (k=3) en de n-gram-embeddingtabel van 47.7 GiB gelezen vanaf NVMe.
  3. 28 septemberNieuwe LLM-benchmarkQwen3.8-Flash-Next — RTX PRO 6000Qwen3.8-Flash-Next (176B) op één RTX PRO 6000: NVFP4-gewichten geserveerd met SGLang, met MTP voor speculatieve decodering (k=3) en de n-gram-embeddingtabel van 47.7 GiB in systeem-RAM.
  4. 28 septemberNieuwe LLM-benchmarkMiMo-V2.6-Pro-RL — DGX B300MiMo-V2.6-Pro-RL (1.02T) op DGX B300: FP4-gewichten geserveerd met vLLM op vier GPU's (TP4), met DFlash speculatieve decodering (k=7) en een context van 1M tokens.
  5. 18 septemberNieuwe CV-benchmarkPeopleNet INT8 — Jetson AGX ThorPeopleNet-persoonsdetectie (INT8, invoer 960×544) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
  6. 18 septemberNieuwe CV-benchmarkYOLO11-N — Jetson AGX ThorYOLO11-N-objectdetectie (invoer 640×640) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 30 gelijktijdige camera's.
  7. 18 septemberNieuwe CV-benchmarkYOLO11S — Jetson AGX ThorYOLO11S-objectdetectie (invoer 640×640) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
  8. 18 septemberNieuwe CV-benchmarkYOLO11M — Jetson AGX ThorYOLO11M-objectdetectie (invoer 640×640) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
  9. 18 septemberNieuwe CV-benchmarkYOLO11L — Jetson AGX ThorYOLO11L-objectdetectie (invoer 640×640) op Jetson AGX Thor: frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
  10. 17 septemberNieuwe whitepaperDeepSeek-V4.1-Flash-deployment op 8× DGX Spark met TP8Deployment van DeepSeek-V4.1-Flash (763B MoE, FP8, DSpark k=5) op 8× NVIDIA DGX Spark (GB10) met TP8: twee configuraties (300K met Engram in het geheugen, 1M met Engram-on-disk), NCCL-optimalisatie, benchmarkresultaten en vergelijking met TP4.
  11. 17 septemberNieuwe LLM-benchmarkDeepSeek-V4.1-Flash — 8× DGX SparkDeepSeek-V4.1-Flash (763B) op 8× DGX Spark: FP8-gewichten geserveerd met vLLM over acht nodes (TP8), met DSpark speculatieve decodering (k=5) en een context van 300K, de Engram-tabel in het geheugen.
  12. 17 septemberNieuwe LLM-benchmarkDeepSeek-V4.1-Flash — 8× DGX SparkDeepSeek-V4.1-Flash (763B) op 8× DGX Spark: dezelfde TP8-opstelling met een context van 1M tokens, de Engram-tabel verplaatst naar schijf.
  13. 16 septemberNieuwe whitepaperDeepSeek-V4.1-Flash-deployment op 4× DGX SparkDeployment van DeepSeek-V4.1-Flash (763B MoE, FP8, DSpark k=5) op 4× NVIDIA DGX Spark (GB10) met tensorparallellisme: vLLM-buildketen, 7 patches voor SM 12.1a, Engram-on-disk, benchmarkresultaten en vergelijking met B300.
  14. 16 septemberNieuwe LLM-benchmarkDeepSeek-V4.1-Flash — 4× DGX SparkDeepSeek-V4.1-Flash (763B) op 4× DGX Spark: FP8-gewichten geserveerd met vLLM over vier nodes (TP4), met DSpark speculatieve decodering (k=5) en een context van 300K.
  15. 16 septemberNieuwe CV-benchmarkPeopleNet INT8 — GB10PeopleNet-persoonsdetectie (INT8, invoer 960×544) op GB10 (DGX Spark): frames per seconde per camera, gemeten van 1 tot 32 gelijktijdige camera's.
  16. 16 septemberNieuwe CV-benchmarkPeopleNet INT8 — Jetson Orin NanoPeopleNet-persoonsdetectie (INT8, invoer 960×544) op Jetson Orin Nano: frames per seconde per camera, gemeten van 1 tot 8 gelijktijdige camera's.
  17. 16 septemberNieuwe CV-benchmarkPeopleNet INT8 — RTX 3060PeopleNet-persoonsdetectie (INT8, invoer 960×544) op RTX 3060: frames per seconde per camera, gemeten van 1 tot 16 gelijktijdige camera's.
  18. 16 septemberNieuwe CV-benchmarkPeopleNet INT8 — RTX 3090PeopleNet-persoonsdetectie (INT8, invoer 960×544) op RTX 3090: frames per seconde per camera, gemeten van 1 tot 30 gelijktijdige camera's.
  19. 16 septemberNieuwe CV-benchmarkYOLO11-N — RTX 3090YOLO11-N-objectdetectie (invoer 640×640) op RTX 3090: frames per seconde per camera, gemeten van 1 tot 28 gelijktijdige camera's.
  20. 14 septemberNieuwe LLM-benchmarkDeepSeek-V4.1-Flash — DGX B300DeepSeek-V4.1-Flash (763B) op DGX B300: FP8-gewichten geserveerd met vLLM op vier GPU's (TP4), met DSpark speculatieve decodering (k=3) en een context van 1M tokens.
  21. 14 septemberNieuwe LLM-benchmarkTencent-Hy4-preview — DGX B300Tencent-Hy4-preview (780B) op DGX B300: BF16-gewichten geserveerd met vLLM op alle acht GPU's (TP8), met MTP voor speculatieve decodering (k=3) en een context van 512K.
  22. 14 septemberNieuwe LLM-benchmarkDeepSeek-V4-Flash-Vision-Exp — 2× DGX SparkDeepSeek-V4-Flash-Vision-Exp (305B) op 2× DGX Spark: FP8-gewichten geserveerd met vLLM over beide nodes (TP2), met DSpark speculatieve decodering (k=3) en een context van 131K.
  23. 4 septemberNieuwe LLM-benchmarkGLM-5.3 — 8× DGX SparkGLM-5.3 (753B) op 8× DGX Spark: NVFP4-gewichten geserveerd met vLLM over acht nodes (TP8), met de ingebouwde MTP van het model voor speculatieve decodering (k=4) en een context van 256K.
  24. 4 septemberNieuwe LLM-benchmarkMuse-Glimmer-30B — RTX PRO 6000Muse-Glimmer-30B op één RTX PRO 6000: BF16-gewichten geserveerd met vLLM, met DFlash speculatieve decodering via de ingebouwde MTP van het model (k=15).
  25. 1 septemberNieuwe LLM-benchmarkGLM-5.3 — DGX B300GLM-5.3 (753B) op DGX B300: FP8-gewichten geserveerd met SGLang op vier GPU's (TP4), met een context van 1M tokens.

augustus 2026

  1. 3 augustusNieuwe whitepaperNVIDIA DGX B300 vs GB300 NVL72: vergelijking van clusterarchitecturenTechnische vergelijking van twee NVIDIA Blackwell Ultra-architecturen, DGX B300 en GB300 NVL72: systeemontwerp, schaalaanpak, netwerkfabric, stroom en koeling, en welke workloads bij welk platform passen.

juli 2026

  1. 30 juliNieuwe whitepaperKimi K3-inferentiebenchmark op DGX-B300Prestatie-evaluatie van Moonshot AI Kimi K3 (2.8T MoE, MXFP4) op NVIDIA DGX-B300 (8x Blackwell Ultra, TP=8): vLLM versus SGLang, direct versus DSpark speculatieve decodering, met capaciteitsplanning op basis van SLO's.
  2. 30 juliNieuwe whitepaperInstallatiehandleiding voor een DGX Spark AI-cluster met 3 nodesInstallatie van een AI-cluster in ringtopologie (mesh) met 3 NVIDIA DGX Spark-nodes: management- en compute-netwerk, RoCEv2/RDMA, sparkrun-configuratie.
  3. 30 juliNieuwe whitepaperInstallatiehandleiding voor een DGX Spark AI-cluster met 2 nodesInstallatie van een AI-cluster in point-to-point-topologie met 2 NVIDIA DGX Spark-nodes: management- en compute-netwerk, RoCEv2/RDMA, sparkrun-configuratie.
  4. 24 juliNieuwe whitepaperInstallatiehandleiding voor een DGX Spark AI-cluster met 8 nodesInstallatie van een switchgebaseerd AI-cluster met 8 NVIDIA DGX Spark-nodes via een MikroTik CRS804 met 200G-breakout: management- en compute-netwerk, RoCEv2/RDMA, sparkrun en NAS.
  5. 24 juliNieuwe whitepaperInstallatiehandleiding voor een DGX Spark AI-cluster met 4 nodesInstallatie van een switchgebaseerd AI-cluster met 4 NVIDIA DGX Spark-nodes via een MikroTik CRS812: management- en compute-netwerk, RoCEv2/RDMA, sparkrun en NAS.
  6. 6 juliNieuwe whitepaperSchaling van Qwen3.6-27B op een DGX Spark-clusterSchalingsstudie over meerdere nodes van Qwen3.6-27B-NVFP4 op 1x, 2x en 4x NVIDIA DGX Spark (GB10): tensorparallellisme over 200GbE, capaciteitsplanning op basis van SLO's en advies voor de keuze tussen TP en replicatie bij deployment.
  7. 3 juliNieuwe whitepaperQwen3.6-27B DGX Spark-benchmarkPrestatie-evaluatie van het Qwen3.6-27B-model op het NVIDIA DGX Spark (GB10)-platform met de kwantisatievarianten FP8, FP8-MTP, AWQ-MTP, NVFP4 en NVFP4-MTP.

juni 2026

  1. 30 juniNieuwe whitepaperHandleiding voor lokaal LLM-gebruikIntegrale beslisgids voor lokaal LLM-gebruik: hardware (NVIDIA Jetson, RTX PRO, DGX Spark, DGX/HGX), modelkeuze, softwarestack en koppeling aan scenario's.