Discussies over AI lopen vaak vast op meningen: de een vindt het hype, de ander ziet de wereld veranderen. Gelukkig bestaat er inmiddels solide meetwerk. De onderzoeksorganisaties METR en Epoch AI volgen de ontwikkeling al jaren met consistente methoden. Hun cijfers geven een nuchter maar opmerkelijk beeld.
De zevenmaandenregel
METR meet de duur die een menselijke expert nodig heeft voor een taak die een AI-agent met een voorspelde slagingskans van 50% kan afronden. In de historische meetreeks verdubbelde deze "taakhorizon" gemiddeld ongeveer elke zeven maanden. Dat is een trend in een afgebakende benchmarkset, geen garantie dat iedere bedrijfsworkflow volgens hetzelfde tempo automatiseerbaar wordt.
De tijdshorizon beschrijft bovendien de geschatte menselijke werktijd van een taak, niet hoe lang een agent zonder toezicht actief blijft. De uitkomst hangt af van taakselectie, beschikbare tools en de gekozen succesgrens. Voor kritiek werk blijven evaluaties, autorisaties en menselijke controle nodig.
De benchmarks erachter
Benchmarks laten op meerdere domeinen vooruitgang zien, maar een hogere benchmarkscore is nog geen businesscase. Een taak kan technisch haalbaar zijn en toch ongeschikt blijven door foutkosten, datatoegang, latency, privacy of benodigde menselijke controle. Test daarom met representatieve eigen cases en een vooraf bepaalde acceptatiegrens.
Wat betekent dit voor uw planning?
Drie praktische conclusies horen we terug in gesprekken met IT-managers:
- Wachten tot AI "volwassen" is, is een risicostrategie. Wie investeringen uitstelt tot de ontwikkeling stabiliseert, wacht op iets dat de cijfers niet laten zien. Beter is een architectuur die meebeweegt: modellen verwisselbaar, data ontsloten, infrastructuur schaalbaar.
- Beoordeel op workloads, niet op modelnamen. Wat vorig jaar faalde, kan vandaag werken. Use-cases die een jaar geleden strandden, verdienen elk halfjaar een hertoets.
- De kostenkant beweegt eveneens. Modelprijzen, hardware en gebruikspatronen veranderen. Herbereken de keuze tussen cloud, on-premise en hybride daarom periodiek met uw eigen volumes. Onze kostencalculator helpt de aannames zichtbaar te maken.
Een nuchtere kanttekening
Extrapolatie is geen voorspelling. Er zijn serieuze wetenschappers die betogen dat de groei op een sigmoïde — een afvlakkende S-curve — kan uitkomen. Maar zelfs als het tempo halveert, blijft de praktische les overeind: plan voor beweging, niet voor stilstand.
Bronnen
- METR — Time Horizon Hub: actuele resultaten en methodologische uitleg.
- METR — Measuring AI Ability to Complete Long Tasks: oorspronkelijke analyse en beperkingen.
- METR — RCT met ervaren open-sourceontwikkelaars: voorbeeld dat benchmarkvooruitgang niet automatisch tijdwinst in de praktijk betekent.