๐Ÿงฉ Zware taken

Vier uitdagende taken die meerdere cognitieve vaardigheden tegelijk testen: redeneren, programmeren, structureren, en instructies volgen.

Wat test dit?

Vier taken die elk een combinatie van vaardigheden vereisen โ€” je kunt niet "รฉรฉn ding goed doen" en slagen. Dit is de meest discriminerende testcategorie: modellen die hier falen, vallen op meerdere dimensies door de mand.

Aantal taken
4
Max tokens
3000
Temperature
0.3
Thinking
UIT aanbevolen

De 4 taken

  1. Multi-stap rekenen: Drie ploegen met wisselende snelheden, pauzes, en starttijden โ€” hoeveel pakketten totaal?
  2. LRU-cache implementatie: Schrijf een Python klasse met O(1) get/put operaties
  3. Notulen-structurering: Transformeer een raadsvergaderingstranscript naar gestructureerde notulen
  4. Strikte JSON-instructies: Produceer exact gespecificeerde JSON met woordlimiet, veldvalidatie

๐Ÿ† Winnaars

๐Ÿ†

8 modellen scoren 4/4

GPT-OSS-120B, Gemma 4 31B, Qwen3-30B-A3B, Nemotron-3-Super, Nemotron-Nano, DeepSeek-V3, Qwen3.6-35B, en Kimi-K2. Alle acht voltooien alle vier de taken foutloos.

Uniek: Gemma 4 31B loste de rekenvraag correct op zonder thinking โ€” het enige model dat dit lukte. Alle andere 4/4-modellen vereisen thinking AAN voor de rekenvraag.

Wat onthult deze test?

Thinking: zegen en vloek

De harde taken onthullen de dualiteit van thinking-modus: voor rekenen is het essentieel, voor formaat-taken (notulen, JSON) is het contraproductief. Modellen die thinking forceren bij formaat-taken produceren vaak te lange, over-gestructureerde output die de JSON-validatie niet haalt.

Formaat-discipline is zeldzaam

De JSON-taak is verrassend moeilijk: veel modellen produceren geldige JSON maar schenden de constraints (te veel woorden, verkeerd aantal kernwoorden, ontbrekende velden). Dit test niet intelligentie maar instructie-volgend vermogen โ€” een cruciale eigenschap voor productie-gebruik.

Alle modellen

ModelScoreDetails

Methodologie

Elk model krijgt dezelfde 4 taken in dezelfde volgorde. Scoring: rekenen (correct eindantwoord), code (aanwezigheid LRUCache + OrderedDict), notulen (alle 3 headers), JSON (valide JSON + alle constraints).

python3 scripts/bench_hard.py <port> <model_name>

Gebruik --nothink voor formaat-taken โ€” rekenen vereist thinking AAN voor de meeste modellen.