04Het verhaal: zes testrondes
Waarom dit zes rondes duurde, en wat elke ronde ons leerde.
1๏ธโฃDe eerste kandidaat, en een harde geheugen-les
GPT-OSS-120B was de voor de hand liggende eerste keuze โ native ontworpen voor precies dit soort hardware. Daarna probeerden we Qwen3-235B-A22B op de grootste quant die "net" leek te passen (134GB) โ en dat ging mis: llama.cpp offloadde een deel naar de CPU en de snelheid stortte in van tientallen tokens/sec naar 2 tokens/sec. Les: reken een marge van 15-20GB voor context/overhead, quantiseer niet tot de rand.
2๏ธโฃDe Chinese labs, en een architecturale ontdekking
GLM-4.5-Air maakte een rekenfout ondanks een lange interne denkstap. MiniMax-M2 liep vast in een letterlijke herhalingslus op een notulen-taak. Maar de belangrijkste ontdekking kwam van DeepSeek-R1-Distill-Llama-70B: als dense model (alle parameters actief per token) kelderde de snelheid naar 2,9 t/s. Op deze bandbreedte-gelimiteerde hardware is MoE-architectuur belangrijker dan merk, leverancier of modelgrootte.
3๏ธโฃZwaardere testen, gelijke lat
De testset discrimineerde niet meer scherp genoeg โ bijna alles scoorde 4/4. We voegden een long-context test toe (feiten verspreid door een 8k-token document) en een 5x-herhalingstest, specifiek om het soort loop-bug van MiniMax-M2 systematisch te vangen. Alle overlevende kandidaten scoorden foutloos.
4๏ธโฃNieuwe generatie modellen, en de reken-bottleneck
Tegen een zwaardere reken-/redeneertest (logica, kansrekening, combinatoriek, met opzettelijke datum-valstrikken) bleek het รฉchte onderscheid: GPT-OSS-120B en Nemotron-3-Super-120B-A12B losten alles efficiรซnt op. De hele Qwen3.x-lijn liep bij 40-50% van de vragen leeg binnen een redelijk tokenbudget โ bij รฉรฉn vraag had het model het juiste antwoord intern al twee keer gevalideerd, en bleef het daarna eindeloos twijfelen over de presentatie tot het budget op was.
5๏ธโฃDag-1 test: Nemotron 3.5 Lightning (12 aug 2026)
Eรฉn dag na release door dezelfde batterij: NVIDIA's Nemotron-3.5-Lightning-30B-A3B (3.5B actief, hybride Mamba2-MoE). Vereiste een llama.cpp-upgrade naar b10380, en de standaard-thinking-modus at in de eerste run het complete tokenbudget op (long-context 0/6, notulen 0/5). Met per taaktype de juiste thinking-modus โ uit voor formaat-taken, aan voor rekenwerk โ scoorde het 10/10 rekenen, 13/14 kennis, 6/6 long-context, 5/5 betrouwbaarheid en 4/4 tools, bij 58 t/s op maar 35GB. De snelste prompt-verwerking van alle 17 modellen (1978 t/s) en de nieuwe runner-up achter GPT-OSS-120B.
6๏ธโฃDense perfectie: Google Gemma 4 31B (12 aug 2026)
Direct na Nemotron volgde Google DeepMind's Gemma 4 31B โ het eerste dense model (30.7B, alle parameters actief per token) dat de volledige batterij doorliep, en meteen het eerste dense model met een perfecte score (43/43). De thinking-aanpak is anders dan bij Nemotron: Gemma 4 gebruikt <think>-tags, bestuurbaar via llama.cpp's --reasoning off/on en --reasoning-budget N. Hybride strategie: --reasoning off voor format/long-context/betrouwbaarheid/tools, --reasoning on --reasoning-budget 800 voor rekenen.
De scores: 4/4 zware taken (uniek: rekenvraag correct zรณnder thinking โ 2195 โ wat geen enkel ander model lukte), 6/6 long-context, 5/5 betrouwbaarheid, 4/4 tools, 14/14 kennis (2 combo-vragen correct mรฉt thinking), 10/10 rekenen. Het Mulisch-publicatiejaar had Gemma 4 wรฉl correct (1992), in tegenstelling tot Nemotron-3.5. De keerzijde: 6.4 t/s generatiesnelheid โ 9ร trager dan Nemotron-3.5-Lightning (58 t/s) en 8ร trager dan GPT-OSS-120B (53 t/s). Dit bevestigt opnieuw de dense-vs-MoE-les: bij gelijke kwaliteit kost dense 8-9ร meer tijd per token op bandbreedte-gelimiteerde hardware. Perfect voor batch-verwerking of kwaliteit-boven-snelheid; ongeschikt voor interactief gebruik.