Gartner voorspelt 5x hogere AI-kosten
Producten en IT-leiders die inzetten op autonome AI-agenten krijgen de komende jaren te maken met een forse financiële tegenvaller. Hoewel de kostprijs per individuele AI-token daalt, zullen de totale kosten per zogenaamde agentic workflow tot 2028 meer dan vervijfvoudigen. Dat blijkt uit onderzoek van analistenbureau Gartner.
Analisten spreken van de Inference Paradox: het verschijnsel waarbij betere 'unit economics' (goedkopere tokens) de totale AI-uitgaven juist opsturen, zonder dat daar direct een voorspelbare of evenredige waarde tegenover staat.
Van simpele chatbot naar kostbare agent
De oorzaak van de stijgende kosten ligt in de verschuiving van assistieve AI-functies — zoals een standaard chatbot — naar complexe, meerstaps workflows. Waar een eenvoudige chatbot een query leest en direct een waarschijnlijk antwoord genereert, werkt een AI-agent fundamenteel anders.
"Een AI-agent moet voortdurend redeneren, onderhandelen en zijn eigen stappen in twijfel trekken," licht Will Sommer, Sr. Director Analyst bij Gartner, toe. "Al deze verantwoordelijkheden tellen op. In vergelijking met een basale chatbot-interactie verhoogt het routeren van een taak naar een redeneermodel de inference-kosten voor de aanbieder met minstens een factor vijf — en dat loopt snel verder op naarmate de taak complexer wordt."
Gartner onderscheidt drie trends binnen de huidige token-economie:
Snelle prijsdalingen bij fundament-modellen: De kostprijs om basiselementen van AI te draaien daalt gestaag.
Inzet van duurdere modellen: Efficiëntiewinst maakt de weg vrij voor de uitrol van krachtigere — en per definitie duurdere — modellen om hoogwaardige toepassingen mogelijk te maken.
Extreem hoog token-verbruik: Geavanceerde AI-workflows verbruiken een veelvoud aan tokens vergeleken met traditionele tekstprompts.
Omdat de innovatiesnelheid van AI-functionaliteiten sneller gaat dan de daling van de tokenprijzen, ontstaat een structureel margeprobleem voor productmanagers en IT-organisaties.
Geen universeel, goedkoop model op komst
Volgens Gartner kunnen organisaties er niet op rekenen dat efficiëntere token-modellen het kostenprobleem vanzelf oplossen. "Elke opeenvolgende generatie AI-capaciteit vereist meer, en vaak duurdere, tokens," aldus Sommer. "Er is geen betrouwbaar, universeel en economisch model aan de horizon. Om concurrerende AI-producten te bouwen, is het ontwikkelen en onderhouden van complexe, multi-model ecosystemen noodzakelijk."
Om een positief rendement (ROI) te behalen op geavanceerde AI-agenten, moeten organisaties ofwel exponentieel hogere opbrengsten realiseren, ofwel strikt sturen op inference-tiering, slimme routering en orchestratie. Door taken dynamisch toe te wijzen aan het meest kostenefficiënte AI-model kan het tokenverbruik worden gekalibreerd.
Sommer waarschuwt dat het simpelweg inschakelen van generieke, autonome intelligentie zonder verdere optimalisatie leidt tot een onbeheersbare kostenexplosie: "Dat resulteert in onbegrensde uitgaven die vele malen hoger liggen dan bij een geoptimaliseerd productecosysteem."