04Het verhaal: vier testrondes
Waarom dit vier rondes duurde, en wat elke ronde ons leerde.
1️⃣De eerste kandidaat, en een harde geheugen-les
GPT-OSS-120B was de voor de hand liggende eerste keuze — native ontworpen voor precies dit soort hardware. Daarna probeerden we Qwen3-235B-A22B op de grootste quant die "net" leek te passen (134GB) — en dat ging mis: llama.cpp offloadde een deel naar de CPU en de snelheid stortte in van tientallen tokens/sec naar 2 tokens/sec. Les: reken een marge van 15-20GB voor context/overhead, quantiseer niet tot de rand.
2️⃣De Chinese labs, en een architecturale ontdekking
GLM-4.5-Air maakte een rekenfout ondanks een lange interne denkstap. MiniMax-M2 liep vast in een letterlijke herhalingslus op een notulen-taak. Maar de belangrijkste ontdekking kwam van DeepSeek-R1-Distill-Llama-70B: als dense model (alle parameters actief per token) kelderde de snelheid naar 2,9 t/s. Op deze bandbreedte-gelimiteerde hardware is MoE-architectuur belangrijker dan merk, leverancier of modelgrootte.
3️⃣Zwaardere testen, gelijke lat
De testset discrimineerde niet meer scherp genoeg — bijna alles scoorde 4/4. We voegden een long-context test toe (feiten verspreid door een 8k-token document) en een 5x-herhalingstest, specifiek om het soort loop-bug van MiniMax-M2 systematisch te vangen. Alle overlevende kandidaten scoorden foutloos.
4️⃣Nieuwe generatie modellen, en de reken-bottleneck
Tegen een zwaardere reken-/redeneertest (logica, kansrekening, combinatoriek, met opzettelijke datum-valstrikken) bleek het échte onderscheid: GPT-OSS-120B en Nemotron-3-Super-120B-A12B losten alles efficiënt op. De hele Qwen3.x-lijn liep bij 40-50% van de vragen leeg binnen een redelijk tokenbudget — bij één vraag had het model het juiste antwoord intern al twee keer gevalideerd, en bleef het daarna eindeloos twijfelen over de presentatie tot het budget op was.