๐Ÿ“„ Long-context

Kan een model feiten terugvinden in een ~8.000-token transcript? 6 "needles" verspreid door de tekst โ€” van vroeg tot zeer laat.

Wat test dit?

Een ~8.000-token fictief transcript van een tweedaagse strategieconferentie van "Meridian Logistics Group" met 5 appendices. Er zijn 6 specifieke vragen ("needles") verspreid door de tekst โ€” van vroeg in het document tot helemaal aan het einde.

Needles
6
Transcript
~8K tokens
Temperature
0.1
Thinking
UIT vereist

๐Ÿ† Winnaars

๐Ÿ†

10 modellen scoren 6/6

De meeste geteste modellen halen perfecte needle retrieval โ€” long-context is minder discriminerend dan verwacht bij ~8K tokens.

Cruciaal inzicht: Nemotron-3.5 scoort 0/6 mรฉt thinking AAN en 6/6 met thinking UIT. De denkstap eet het context-budget op, waardoor het model de needles niet meer kan vinden.

Wat onthult deze test?

Thinking is funest voor retrieval

Dit is de belangrijkste les van de hele benchmark: zet thinking UIT voor long-context taken. Het denkproces consumeert een groot deel van het context window โ€” bij Nemotron-3.5 ging de score van 0/6 naar 6/6 puur door thinking uit te zetten.

Positie in de tekst doet ertoe

De needles aan het einde van het transcript (needle 5: stemverhouding, needle 6: juridische toets) worden het vaakst gemist. Dit is het klassieke "lost in the middle" fenomeen, maar dan aan het einde โ€” modellen hebben moeite met informatie die ver van de query verwijderd is.

Alle modellen

ModelScoreNotities

Methodologie

Transcript + 6 vragen in รฉรฉn prompt. Scoring via keyword-matching op genormaliseerde antwoorden (case-insensitive, whitespace-genormaliseerd).

python3 scripts/bench_longctx.py <port> <model_name>

Gebruik altijd --nothink voor deze test.