Hoe snel voelt AI?
Zelfde vraag, zelfde antwoordlengte — maar een wereld van verschil in beleving. Deze simulator laat zien wat tokensnelheid betekent in de praktijk: van een instapmodel op eenvoudige hardware tot een versnelde cloud-endpoint. En met de GPU-simulator hieronder bouwt u een profiel van uw eigen denkbare opstelling.
Zo voelt inference in het echt
Kies een scenario en een opstelling, en kijk hoe het antwoord zich opbouwt. Dit is een getrouwe simulatie van wat uw gebruikers straks zien — van eerste-token-vertraging tot schrijfsnelheid.
Elk scenario streamt zijn eigen type output: een RAG-pipeline toont eerst de zoekstappen, een agent zijn tool-aanroepen, code krijgt syntax-kleuring. Kies een lange antwoordlengte én een hoger tempo om het verschil tussen de opstellingen echt te voelen.
Vier opstellingen, één race
Kies een lange antwoordlengte — bijvoorbeeld 2.000 tokens — en verhoog het tempo om te zien hoe groot het verschil wordt bij écht lange antwoorden: een snelle endpoint is dan in seconden klaar waar een instapmodel tientallen minuten doet.
Zo leest u dit: eerste token is hoe lang het scherm leeg blijft; tokens per seconde is hoe snel het antwoord daarna groeit. De profielen zijn realistische orden van grootte, geen meetresultaten van specifieke systemen.
Bouw uw eigen profiel
Kies een GPU, een open model en het aantal gelijktijdige gebruikers. De schatting volgt de belangrijkste natuurkunde van inference: voor elke token moet het actieve deel van het model uit het geheugen worden gelezen. Snelheid ≈ geheugenbandbreedte ÷ actieve modelgrootte, met een praktijkrendement van 60% voor een goed geconfigureerde stack (bijvoorbeeld vLLM).
Bij MoE-modellen (Mixture of Experts) zoals Qwen3-235B of DeepSeek V4 is alleen een fractie van de parameters actief per token — daarom voelen die verrassend snel voor hun omvang. Het volledige model moet wél in het VRAM passen.
Vier getallen die de beleving bepalen
Time to first token
De stilte voordat het eerste woord verschijnt. Een lange vertraging maakt zelfs een snel model traag in beleving — dit is wat gebruikers als "haperen" ervaren.
Tokens per seconde
De schrijfsnelheid zodra de stream loopt. Boven de ~60 tok/s kan een mens nauwelijks meer meelezen; extra snelheid betaalt zich dan vooral uit bij agents en batchverwerking.
Totale antwoordtijd
Wachttijd plus schrijftijd. Bij lange antwoorden weegt de streamsnelheid zwaarder; bij korte antwoorden de eerste token.
Systeemcapaciteit
Hoeveel gebruikers tegelijk dezelfde ervaring krijgen. Eén snelle stream zegt weinig over veertig medewerkers op maandagochtend — capaciteit vraagt doorrekening.
Wat voelt een snelheid als?
Praktische leidraad, geen kwaliteitsscore. De werkelijke ervaring hangt ook af van eerste-token-vertraging, antwoordlengte en gelijktijdig gebruik.
| Snelheid | Beleving | 300 tokens in | Typisch scenario |
|---|---|---|---|
| 5 tok/s | Merkbaar traag; woord voor woord te volgen | ± 60 seconden | Klein model op beperkte hardware |
| 20 tok/s | Bruikbaar voor normale chat | ± 15 seconden | Balans tussen kosten en reactiviteit |
| 60 tok/s | Snel en soepel | ± 5 seconden | Sneller dan een gebruiker kan lezen |
| 200 tok/s | Het antwoord lijkt er direct te staan | ± 1,5 seconde | Agents, codering en batchworkflows |
Aannames en bronnen
- Geheugenbandbreedtes volgens fabrikantspecificaties: RTX 4090 1.008 GB/s, RTX 5090 ±1.800 GB/s, L40S 864 GB/s, RTX PRO 6000 1.792 GB/s, A100 80GB ±2.039 GB/s, H100 SXM 3.350 GB/s, H200 4.800 GB/s, B200 ±8.000 GB/s.
- Schatting tok/s = bandbreedte ÷ actieve modelgrootte × 0,6. Dit is een bekende vuistregel voor decode-fase inference (zie o.a. de onderbouwing bij Inworld AI, april 2026: een 70B-model in FP16 vraagt ~140 GB geheugenlezing per token).
- VRAM-behoefte @4-bit: ± 0,6 GB per miljard parameters, plus ± 10% marge voor context en KV-cache.
- Gelijktijdige gebruikers verdelen de bandbreedte in deze vereenvoudigde simulatie; moderne stacks (continuous batching in vLLM) beperken dat verlies in de praktijk deels.
- Dit is een educatief model, geen benchmark. Voor een sizing van uw concrete workload meten we op echte hardware.
Benieuwd wat dit voor uw workload betekent?
We rekenen uw concrete scenario door en testen het desgewenst op echte hardware — met uw eigen data en prompts.
Plan een kennismaking