๐Ÿ“š Kennis

14 vragen over scheikunde, geschiedenis, geografie, biologie, wiskunde, technologie, literatuur, astronomie, economie, muziek en natuurkunde โ€” plus 2 kennis+redeneer-combinaties.

Wat test dit?

12 pure kennisvragen uit 12 verschillende domeinen plus 2 "combo"-vragen die kennis combineren met redeneren. Dit test de breedte en accuraatheid van de in het model opgeslagen kennis.

Vragen
14
Domeinen
12
Temperature
0.2
Thinking
UIT (12) / AAN (2)

๐Ÿ† Winnaars

๐Ÿ†

GPT-OSS-120B en Gemma 4 31B scoren 14/14

Beide modellen hebben perfecte feitelijke kennis over 12 domeinen. De meeste andere modellen scoren 11-13/14 โ€” de combo-vragen zijn de grootste uitdaging.

Gemma 4: 12/14 zonder thinking. Met thinking AAN voor alleen de 2 combo-vragen stijgt de score naar 14/14 โ€” het denken helpt specifiek bij het combineren van twee feiten (bijv. leeftijd berekenen uit geboortejaar en datum).

Wat onthult deze test?

Combo-vragen discrimineren het sterkst

De twee combo-vragen (Franse koning in 1789 + aantal regeerjaren; leeftijd Napoleon bij Waterloo) zijn de grootste filters. Modellen weten beide losse feiten vaak wel, maar het combineren ervan vereist een extra redeneerstap die zonder thinking vaak mislukt.

Kennis is breed maar niet uniform

Modellen scoren het best op scheikunde, geschiedenis, en astronomie. Literatuur en muziek zijn de zwakste domeinen โ€” meerdere modellen missen de auteur van "De ontdekking van de hemel" en het aantal delen van Beethovens 9e.

Alle modellen

ModelScoreDetails

Methodologie

14 vragen in รฉรฉn sessie. Scoring via keyword-matching (case-insensitive). Combo-vragen accepteren alternatieve antwoorden (45/46 voor Napoleon).

python3 scripts/bench_knowledge.py <port> <model_name>

Gebruik --nothink voor de 12 pure kennisvragen. De 2 combo-vragen scoren het best met thinking AAN.