Welke GPU voor welk model?
Bij tekstgeneratie bepaalt vrijwel nooit de rekenkracht de snelheid, maar het geheugen: hoeveel er op de kaart past (VRAM) en hoe snel het gelezen wordt (bandbreedte). Deze vergelijker laat die twee eigenschappen zien van een prosumer-kaart van enkele duizenden euro's tot een Blackwell-datacenter-GPU — en rekent door wat dat betekent voor het model dat u wilt draaien.
| GPU ⇅ | VRAM ⇅ | Bandbreedte ⇅ | Past het model? | Geschatte snelheid | Prijsindicatie ⇅ |
|---|
De prijzen zijn bewust conservatief — dus hoog — ingeschat (NL-markt, augustus 2026, o.a. gebaseerd op MSRP en enterprise-inkoopprijzen). In de praktijk liggen ze vaak lager. Snelheidsschatting: bandbreedte ÷ actieve modelgrootte × 0,6 praktijkrendement; bij meerdere kaarten geldt 10% verlies op de gezamenlijke bandbreedte.
Waarom bandbreedte alles bepaalt
Bij het genereren van tekst leest de GPU voor elke nieuwe token het actieve deel van het model opnieuw uit het geheugen. Een 70B-model op 4-bit is ± 42 GB — bij 60 tokens per seconde moet de kaart dus ruim 2,5 TB per seconde aan geheugen lezen. Daarom zit het verschil tussen een RTX 4090 (1 TB/s) en een B200 (8 TB/s) niet in procenten, maar in een andere orde van grootte.
De interconnect valt niet te overslaan
Moet één groot model over meerdere kaarten worden verdeeld (tensor-parallellisatie), dan praten die kaarten constant met elkaar. Datacenter-GPU's doen dat via NVLink (900 GB/s tot 1,8 TB/s); workstation-kaarten via PCIe (± 128 GB/s). Benchmarks tonen dat een 8×-workstationconfiguratie op zo'n workload tot een derde van de doorvoer van een 8×-NVLink-systeem haalt. Voor meerdere losse modellen naast elkaar (data-parallellisatie) maakt die interconnect veel minder uit.
Bronnen
- Specificaties volgens fabrikantspagina's van NVIDIA (VRAM, geheugentype, bandbreedte, NVLink-generaties), augustus 2026.
- B200-specificaties: 192 GB HBM3e, ±8 TB/s, NVLink 5 (1,8 TB/s) — bevestigd door meerdere cloudproviders (RunPod, VESSL, JarvisLabs, 2026).
- RTX PRO 6000 vs. H100-analyse inclusief PCIe- vs. NVLink-effect bij tensor-parallellisatie: OpenMetal, juli 2026.
- Bandbreedte-als-beperkende-factor bij inference: Inworld AI, B200-gids (april 2026).
- Prijzen: NVIDIA MSRP RTX PRO 6000 $13.250 (juni 2026); H200-marktprijzen $35.000–45.000 (2026); overige bedragen zijn afgeronde, bewust hoge NL-inschattingen.
Twijfelt u tussen twee configuraties?
We toetsen uw keuze aan uw workload, uw budget en uw datacenter — en kunnen een proof-of-concept op echte hardware draaien voordat u investeert.
Plan een kennismaking