๐Ÿงช GX10 LLM Benchmark Suite

Welk lokaal LLM is รฉcht het snelst รฉn slimst op een NVIDIA DGX Spark-klasse machine (128GB unified memory)? 17 modellen zelf gedownload, zelf gedraaid, zelf getest โ€” inclusief de modellen die faalden en waarom.

๐Ÿ–ฅ๏ธ GB10 Grace Blackwell ยท 128GB unified ๐Ÿ“ฆ 17 modellen getest ๐Ÿ”ฌ 7 testcategorieรซn โœ… alles zelf geverifieerd, geen blog-cijfers

01De winnaar

Perfecte score op elke testcategorie, en 3ร— sneller dan de enige gelijkwaardige concurrent.

๐Ÿฅ‡

GPT-OSS-120B โ€” OpenAI, Apache 2.0

117B totaal / 5,1B actief ยท MoE ยท 59GB (UD-Q4_K_XL) ยท 53,4 t/s generatie

โœ… zware taken 4/4 โœ… long-context 6/6 โœ… betrouwbaarheid 5/5 โœ… tool-gebruik 4/4 โœ… kennis 14/14 โœ… rekenen 10/10

02Resultaten in grafieken

Live gegenereerd uit docs/data/results.json โ€” nieuwe modeltests verschijnen hier automatisch na een push.

โšก Generatiesnelheid (tokens/sec)

Gemeten met llama-bench / server-timings. Hoger = sneller.

๐Ÿงฎ Score op de zware reken-/redeneertest (van 10)

Alleen modellen die deze specifieke testronde doorliepen. Dit is waar de meeste modellen zich daadwerkelijk van elkaar onderscheiden.

๐Ÿ’พ Omvang op schijf vs. snelheid

Grotere bubbel = meer totale parameters. Rechtsonder is de ideale hoek: klein รฉn snel.

03Volledige scorematrix

Alle 15 geteste modellen, alle categorieรซn. Niet elk model doorliep elke test (zie toelichting per rij in het README).

โœ… geslaagd โš ๏ธ gedeeltelijk / met kanttekening โŒ gefaald โ€“ niet getest
ModelUitgeverArchitectuurSchijf SnelheidZware takenLong-ctx BetrouwbaarToolsKennisRekenen

04Het verhaal: zes testrondes

Waarom dit zes rondes duurde, en wat elke ronde ons leerde.

1๏ธโƒฃDe eerste kandidaat, en een harde geheugen-les

GPT-OSS-120B was de voor de hand liggende eerste keuze โ€” native ontworpen voor precies dit soort hardware. Daarna probeerden we Qwen3-235B-A22B op de grootste quant die "net" leek te passen (134GB) โ€” en dat ging mis: llama.cpp offloadde een deel naar de CPU en de snelheid stortte in van tientallen tokens/sec naar 2 tokens/sec. Les: reken een marge van 15-20GB voor context/overhead, quantiseer niet tot de rand.

2๏ธโƒฃDe Chinese labs, en een architecturale ontdekking

GLM-4.5-Air maakte een rekenfout ondanks een lange interne denkstap. MiniMax-M2 liep vast in een letterlijke herhalingslus op een notulen-taak. Maar de belangrijkste ontdekking kwam van DeepSeek-R1-Distill-Llama-70B: als dense model (alle parameters actief per token) kelderde de snelheid naar 2,9 t/s. Op deze bandbreedte-gelimiteerde hardware is MoE-architectuur belangrijker dan merk, leverancier of modelgrootte.

3๏ธโƒฃZwaardere testen, gelijke lat

De testset discrimineerde niet meer scherp genoeg โ€” bijna alles scoorde 4/4. We voegden een long-context test toe (feiten verspreid door een 8k-token document) en een 5x-herhalingstest, specifiek om het soort loop-bug van MiniMax-M2 systematisch te vangen. Alle overlevende kandidaten scoorden foutloos.

4๏ธโƒฃNieuwe generatie modellen, en de reken-bottleneck

Tegen een zwaardere reken-/redeneertest (logica, kansrekening, combinatoriek, met opzettelijke datum-valstrikken) bleek het รฉchte onderscheid: GPT-OSS-120B en Nemotron-3-Super-120B-A12B losten alles efficiรซnt op. De hele Qwen3.x-lijn liep bij 40-50% van de vragen leeg binnen een redelijk tokenbudget โ€” bij รฉรฉn vraag had het model het juiste antwoord intern al twee keer gevalideerd, en bleef het daarna eindeloos twijfelen over de presentatie tot het budget op was.

5๏ธโƒฃDag-1 test: Nemotron 3.5 Lightning (12 aug 2026)

Eรฉn dag na release door dezelfde batterij: NVIDIA's Nemotron-3.5-Lightning-30B-A3B (3.5B actief, hybride Mamba2-MoE). Vereiste een llama.cpp-upgrade naar b10380, en de standaard-thinking-modus at in de eerste run het complete tokenbudget op (long-context 0/6, notulen 0/5). Met per taaktype de juiste thinking-modus โ€” uit voor formaat-taken, aan voor rekenwerk โ€” scoorde het 10/10 rekenen, 13/14 kennis, 6/6 long-context, 5/5 betrouwbaarheid en 4/4 tools, bij 58 t/s op maar 35GB. De snelste prompt-verwerking van alle 17 modellen (1978 t/s) en de nieuwe runner-up achter GPT-OSS-120B.

6๏ธโƒฃDense perfectie: Google Gemma 4 31B (12 aug 2026)

Direct na Nemotron volgde Google DeepMind's Gemma 4 31B โ€” het eerste dense model (30.7B, alle parameters actief per token) dat de volledige batterij doorliep, en meteen het eerste dense model met een perfecte score (43/43). De thinking-aanpak is anders dan bij Nemotron: Gemma 4 gebruikt <think>-tags, bestuurbaar via llama.cpp's --reasoning off/on en --reasoning-budget N. Hybride strategie: --reasoning off voor format/long-context/betrouwbaarheid/tools, --reasoning on --reasoning-budget 800 voor rekenen.

De scores: 4/4 zware taken (uniek: rekenvraag correct zรณnder thinking โ€” 2195 โ€” wat geen enkel ander model lukte), 6/6 long-context, 5/5 betrouwbaarheid, 4/4 tools, 14/14 kennis (2 combo-vragen correct mรฉt thinking), 10/10 rekenen. Het Mulisch-publicatiejaar had Gemma 4 wรฉl correct (1992), in tegenstelling tot Nemotron-3.5. De keerzijde: 6.4 t/s generatiesnelheid โ€” 9ร— trager dan Nemotron-3.5-Lightning (58 t/s) en 8ร— trager dan GPT-OSS-120B (53 t/s). Dit bevestigt opnieuw de dense-vs-MoE-les: bij gelijke kwaliteit kost dense 8-9ร— meer tijd per token op bandbreedte-gelimiteerde hardware. Perfect voor batch-verwerking of kwaliteit-boven-snelheid; ongeschikt voor interactief gebruik.

05Belangrijkste lessen

๐Ÿ—๏ธ

MoE > dense, punt

Op bandbreedte-gelimiteerde hardware kan een dense 70B-model 15-20x trager zijn dan een MoE-model van vergelijkbare grootte. Check dit vรณรณr je downloadt.

๐Ÿ“

Quantiseer niet tot de rand

Reken 15-20GB marge boven de modelgrootte voor context/KV-cache, anders forceer je CPU-offload en wordt het model onbruikbaar traag.

๐Ÿง 

Reasoning kan zijn eigen budget opeten

Zonder ruim max_tokens (2000+) en zonder te checken op reasoning_content naast content lijkt een goed model plots "leeg" te antwoorden.

๐Ÿ”€

Ken de thinking-toggle

Qwen3.x: enable_thinking: false. NVIDIA Nemotron: "detailed thinking off". Zet dit allรฉรฉn uit voor pure formaat-taken โ€” voor rekenwerk kost het correctheid.

๐Ÿ”

Snel en correct โ‰  betrouwbaar

Meerdere modellen kwamen intern tot het juiste antwoord maar faalden om het te leveren. Alleen herhalingstests vangen dit systematisch.

๐Ÿ”

Verifieer modelclaims altijd zelf

Publieke "beste LLM"-lijsten bevatten vaak plausibele maar onbetrouwbare informatie. De officiรซle Hugging Face API was onze enige vertrouwde bron.

06Zelf reproduceren

Alle scripts zijn pure Python (stdlib) en praten met een lokale llama-server. Volledige uitleg: scripts/README.md.

git clone https://github.com/sayfjawad/gx10-llm-benchmarks.git
cd gx10-llm-benchmarks

pip install -U "huggingface_hub[cli]"
hf download unsloth/gpt-oss-120b-GGUF --include "UD-Q4_K_XL/*" --local-dir ~/models/gpt-oss-120b

llama-server --model ~/models/gpt-oss-120b/UD-Q4_K_XL/gpt-oss-120b-UD-Q4_K_XL-00001-of-00002.gguf \
  --alias gpt-oss-120b --host 127.0.0.1 --port 8081 --n-gpu-layers 999 --cont-batching

python3 scripts/bench_hard.py 8081 gpt-oss-120b

๐Ÿ’พ Schijfruimte: reken ~50GB voor kleine kandidaten (30-40GB klasse), ~130GB voor grote (~100GB klasse). Sequentieel testen (download โ†’ test โ†’ opruimen โ†’ volgende) houdt 150GB vrije ruimte ruim voldoende, ongeacht hoeveel modellen je wilt vergelijken.