Kan een model feiten terugvinden in een ~8.000-token transcript? 6 "needles" verspreid door de tekst โ van vroeg tot zeer laat.
Een ~8.000-token fictief transcript van een tweedaagse strategieconferentie van "Meridian Logistics Group" met 5 appendices. Er zijn 6 specifieke vragen ("needles") verspreid door de tekst โ van vroeg in het document tot helemaal aan het einde.
De meeste geteste modellen halen perfecte needle retrieval โ long-context is minder discriminerend dan verwacht bij ~8K tokens.
Cruciaal inzicht: Nemotron-3.5 scoort 0/6 mรฉt thinking AAN en 6/6 met thinking UIT. De denkstap eet het context-budget op, waardoor het model de needles niet meer kan vinden.
Dit is de belangrijkste les van de hele benchmark: zet thinking UIT voor long-context taken. Het denkproces consumeert een groot deel van het context window โ bij Nemotron-3.5 ging de score van 0/6 naar 6/6 puur door thinking uit te zetten.
De needles aan het einde van het transcript (needle 5: stemverhouding, needle 6: juridische toets) worden het vaakst gemist. Dit is het klassieke "lost in the middle" fenomeen, maar dan aan het einde โ modellen hebben moeite met informatie die ver van de query verwijderd is.
| Model | Score | Notities |
|---|
Transcript + 6 vragen in รฉรฉn prompt. Scoring via keyword-matching op genormaliseerde antwoorden (case-insensitive, whitespace-genormaliseerd).
python3 scripts/bench_longctx.py <port> <model_name>
Gebruik altijd --nothink voor deze test.