Plan een kennismaking
Tools

Hoe snel voelt AI?

Zelfde vraag, zelfde antwoordlengte — maar een wereld van verschil in beleving. Deze simulator laat zien wat tokensnelheid betekent in de praktijk: van een instapmodel op eenvoudige hardware tot een versnelde cloud-endpoint. En met de GPU-simulator hieronder bouwt u een profiel van uw eigen denkbare opstelling.

Scherm met streamende tekens en motion blur — tokens die in realtime gegenereerd worden

01 · Live demonstratie

Zo voelt inference in het echt

Kies een scenario en een opstelling, en kijk hoe het antwoord zich opbouwt. Dit is een getrouwe simulatie van wat uw gebruikers straks zien — van eerste-token-vertraging tot schrijfsnelheid.

Opstelling
Antwoordlengte · 600 tokens
Tempo ·
inference-demo — chat — assistent-antwoord
Eerste token
Snelheid
Tokens0
Tijd0,0 s
Context4.096 tokens

Elk scenario streamt zijn eigen type output: een RAG-pipeline toont eerst de zoekstappen, een agent zijn tool-aanroepen, code krijgt syntax-kleuring. Kies een lange antwoordlengte én een hoger tempo om het verschil tussen de opstellingen echt te voelen.


02 · Vergelijking

Vier opstellingen, één race

Kies een lange antwoordlengte — bijvoorbeeld 2.000 tokens — en verhoog het tempo om te zien hoe groot het verschil wordt bij écht lange antwoorden: een snelle endpoint is dan in seconden klaar waar een instapmodel tientallen minuten doet.

Zo leest u dit: eerste token is hoe lang het scherm leeg blijft; tokens per seconde is hoe snel het antwoord daarna groeit. De profielen zijn realistische orden van grootte, geen meetresultaten van specifieke systemen.


GPU-simulator

Bouw uw eigen profiel

Kies een GPU, een open model en het aantal gelijktijdige gebruikers. De schatting volgt de belangrijkste natuurkunde van inference: voor elke token moet het actieve deel van het model uit het geheugen worden gelezen. Snelheid ≈ geheugenbandbreedte ÷ actieve modelgrootte, met een praktijkrendement van 60% voor een goed geconfigureerde stack (bijvoorbeeld vLLM).

Bij MoE-modellen (Mixture of Experts) zoals Qwen3-235B of DeepSeek V4 is alleen een fractie van de parameters actief per token — daarom voelen die verrassend snel voor hun omvang. Het volledige model moet wél in het VRAM passen.

Glasvezelbundel met datapulsen — geheugenbandbreedte bepaalt tokensnelheid
Geheugenbandbreedte is bij tekstgeneratie vrijwel altijd de beperkende factor — niet de rekenkernen.

Begrippen

Vier getallen die de beleving bepalen

01

Time to first token

De stilte voordat het eerste woord verschijnt. Een lange vertraging maakt zelfs een snel model traag in beleving — dit is wat gebruikers als "haperen" ervaren.

02

Tokens per seconde

De schrijfsnelheid zodra de stream loopt. Boven de ~60 tok/s kan een mens nauwelijks meer meelezen; extra snelheid betaalt zich dan vooral uit bij agents en batchverwerking.

03

Totale antwoordtijd

Wachttijd plus schrijftijd. Bij lange antwoorden weegt de streamsnelheid zwaarder; bij korte antwoorden de eerste token.

04

Systeemcapaciteit

Hoeveel gebruikers tegelijk dezelfde ervaring krijgen. Eén snelle stream zegt weinig over veertig medewerkers op maandagochtend — capaciteit vraagt doorrekening.


Oriëntatie

Wat voelt een snelheid als?

Praktische leidraad, geen kwaliteitsscore. De werkelijke ervaring hangt ook af van eerste-token-vertraging, antwoordlengte en gelijktijdig gebruik.

SnelheidBeleving300 tokens inTypisch scenario
5 tok/sMerkbaar traag; woord voor woord te volgen± 60 secondenKlein model op beperkte hardware
20 tok/sBruikbaar voor normale chat± 15 secondenBalans tussen kosten en reactiviteit
60 tok/sSnel en soepel± 5 secondenSneller dan een gebruiker kan lezen
200 tok/sHet antwoord lijkt er direct te staan± 1,5 secondeAgents, codering en batchworkflows

Feitencheck

Aannames en bronnen

  • Geheugenbandbreedtes volgens fabrikantspecificaties: RTX 4090 1.008 GB/s, RTX 5090 ±1.800 GB/s, L40S 864 GB/s, RTX PRO 6000 1.792 GB/s, A100 80GB ±2.039 GB/s, H100 SXM 3.350 GB/s, H200 4.800 GB/s, B200 ±8.000 GB/s.
  • Schatting tok/s = bandbreedte ÷ actieve modelgrootte × 0,6. Dit is een bekende vuistregel voor decode-fase inference (zie o.a. de onderbouwing bij Inworld AI, april 2026: een 70B-model in FP16 vraagt ~140 GB geheugenlezing per token).
  • VRAM-behoefte @4-bit: ± 0,6 GB per miljard parameters, plus ± 10% marge voor context en KV-cache.
  • Gelijktijdige gebruikers verdelen de bandbreedte in deze vereenvoudigde simulatie; moderne stacks (continuous batching in vLLM) beperken dat verlies in de praktijk deels.
  • Dit is een educatief model, geen benchmark. Voor een sizing van uw concrete workload meten we op echte hardware.
Verlicht datacenter-gangpad dat naar een lichtpunt leidt
Volgende stap

Benieuwd wat dit voor uw workload betekent?

We rekenen uw concrete scenario door en testen het desgewenst op echte hardware — met uw eigen data en prompts.

Plan een kennismaking