๐Ÿงฎ Rekenen & redeneren

10 wiskundige en logische problemen โ€” van kansrekening tot valstrikvragen. De zwaarste en meest discriminerende test van de suite.

Wat test dit?

Tien problemen die oplopen in moeilijkheidsgraad, verspreid over 8 wiskundige domeinen plus 2 valstrikvragen. Dit is de zwaarste test van de hele suite: de meeste modellen falen op minstens de helft van de vragen, en alleen de absolute top haalt 10/10.

De 8 domeinen

  1. Logica โ€” deductief redeneren met meerdere condities
  2. Kansrekening โ€” voorwaardelijke kansen (Bayesiaans redeneren)
  3. Combinatoriek โ€” telproblemen en permutaties
  4. Algebra โ€” stelsel vergelijkingen met meerdere onbekenden
  5. Getaltheorie โ€” modulo-rekenen en priemgetallen
  6. Meetkunde โ€” oppervlakte/volume met impliciete relaties
  7. Samengestelde rente โ€” financiรซle wiskunde met jaarlijkse compounding
  8. Schatting/Fermi โ€” orde-van-grootte benaderingen

Plus 2 valstrikvragen die expres misleidend zijn geformuleerd โ€” het model moet de valkuil herkennen, niet het voor de hand liggende foute antwoord geven.

Aantal vragen
10
Max tokens
2000
Temperature
0.2
Thinking
AAN vereist

๐Ÿ† Winnaars

๐Ÿ†

4 modellen scoren 10/10

GPT-OSS-120B, Nemotron-3-Super-120B, Nemotron-3.5-Lightning, en Gemma 4 31B. Alle vier vereisen thinking AAN voor deze score.

Token-efficiรซntie: GPT-OSS gebruikt 250-872 tokens per antwoord. Nemotron-3.5: 571-1959. Gemma 4 met --reasoning-budget 800: 228-1585 tokens. Nemotron-3-Super: 129-917. GPT-OSS en Nemotron-3-Super zijn het efficiรซntst.

Wat onthult deze test?

De Qwen3.x-familie: structureel zwak in rekenen

โš ๏ธ Qwen3.6-35B: 6/10, Qwen3.5-122B: 5/10. Beide modellen lopen binnen het standaard 2000-tokenbudget leeg โ€” het denkproces is te verbose. Met 6000 tokens haalt Qwen3.6 9/10, maar รฉรฉn vraag blijft structureel falen, zelfs nadat het model intern het correcte antwoord heeft gevonden. Het faalt in de vertaling van denkstap naar eindantwoord.

Dit is het meest verrassende resultaat van de hele benchmark: de Qwen3.x-lijn is op papier indrukwekkend (30B-235B params, razendsnel, 4/4 op harde taken), maar op rekenwerk presteren ze dramatisch onder hun gewichtsklasse. Het denkproces is kwantitatief veel, maar kwalitatief inefficient โ€” veel tokens die niet tot het juiste antwoord leiden.

Thinking verplicht, geen uitzonderingen

In tegenstelling tot andere tests (waar thinking vaak UIT moet), is rekenen de enige test in de suite waar thinking AAN verplicht is voor alle modellen. Zonder denkstap faalt elk model op de meerderheid van de vragen. Dit bevestigt dat wiskundig redeneren fundamenteel anders is dan kennis-retrieval of formaat-taken โ€” het vereist een sequentieel denkproces dat niet in รฉรฉn forward pass past.

Token-efficiรซntie als kwaliteitssignaal

Niet alle correcte antwoorden zijn gelijk. GPT-OSS-120B lost dezelfde problemen op in 250-872 tokens, terwijl Qwen3.6 er 1220-6000+ voor nodig heeft โ€” en dan nog steeds fout kan zijn. Efficiรซntie in denken is een ondergewaardeerde modelkwaliteit: een model dat 3-10ร— meer tokens nodig heeft voor hetzelfde antwoord, is in productie 3-10ร— duurder en trager.

Gemma 4's unieke positie

Gemma 4 31B is het enige dense model dat 10/10 haalt โ€” alle andere 10/10 modellen zijn MoE. Dit is opmerkelijk omdat dense modellen op deze hardware 3-20ร— trager zijn. Gemma 4 bewijst dat architectuur niet alles zegt: een goed getraind dense model kan net zo accuraat zijn als de beste MoE-modellen, ook op het moeilijkste domein.

Alle modellen

ModelScoreToken-efficiรซntieDetails

Alleen modellen die de volledige 10 vragen hebben beantwoord. Token-aantallen zijn het waargenomen bereik per vraag.

Methodologie

Elk model krijgt dezelfde 10 vragen, in dezelfde volgorde. Scoring is handmatig op correct eindantwoord (tussenliggende denkstappen worden niet beoordeeld, maar het eindantwoord moet exact kloppen). Voor de valstrikvragen telt alleen het antwoord dat de valkuil herkent en vermijdt.

python3 scripts/bench_math.py <port> <model_name>

Dit script heeft gรฉรฉn nothink optie โ€” rekenen vereist altijd thinking AAN. Voor Gemma 4 werd de server gestart met --reasoning on --reasoning-budget 800 om te voorkomen dat het model 1864+ tokens per vraag verbruikte (zonder budget-limiet duurde de volledige test ~2 uur).