Spotify verlaagt tokenkosten van AI-coding met 90 procent via Portal
Het gebruik van geavanceerde AI-coderingsagents zoals Claude Code brengt aanzienlijke operationele kosten met zich mee. Een groot deel van het verwerkte tokenvolume bestaat niet uit complexe redeneertaken, maar uit standaard I/O-werkzaamheden—zoals het doorlezen van omvangrijke bestanden of het genereren van repetitieve boilerplate-code. Om deze kosten te drukken, biedt Spotify een oplossing via AiKA Modes binnen het ontwikkelplatform Portal by Spotify.
Door routinetaken automatisch om te leiden naar een voordeliger werkmodel, zoals Gemini 2.5 Flash, en het zwaardere denkwerk te bewaren voor het 'frontier'-model, kunnen ontwikkelaars het tokenverbruik met gemiddeld 90 procent terugdringen zo meldt Spotify.
Modulair routingsysteem via AiKA Modes
De oplossing maakt gebruik van zogeheten modes: declaratieve, kortstondige agents die draaien op een Serverless-achtige architectuur. Binnen Portal door Spotify zijn hiervoor twee specifieke modi ingericht:
bulk-reader: Bedoeld voor situaties waarin een agent meerdere grote bestanden moet analyseren om één specifieke vraag te beantwoorden. De modus vat de informatie gestructureerd en beknopt samen.
code-writer: Bestemd voor het gegenereerd krijgen van tests, configuraties en stubs op basis van bestaande patronen. De output bestaat uitsluitend uit code, die rechtstreeks naar de schijf kan worden geschreven zonder het contextvenster van het hoofdmodel te belasten.
Automatisering via de 'Shunt'-plugin
Om te voorkomen dat de hoofdagent zelf moet kiezen wanneer een taak wordt gedelegeerd, heeft Spotify een Claude Code-plugin genaamd Shunt ontwikkeld. Deze plugin werkt met twee lagen:
PreToolUse Hooks: Wanneer een leescommando een vooraf ingestelde drempel overschrijdt (bijvoorbeeld een bestand van meer dan 350 regels), blokkeert de hook de directe leesactie en verwijst deze naar de bulk-reader.
Scripts en Skills: Scripts wikkelen de verzoeken af naar de Portal CLI, waarna de resultaten worden verwerkt. Het hoofdmodel krijgt enkel de verwerkte samenvatting te zien.
Beperkingen en randvoorwaarden
Hoewel de tokenbesparingen bij grote lees- en schrijfopdrachten aanzienlijk zijn, is het systeem niet voor alle taken geschikt. Diepgaande foutanalyse (debugging), architecturale beslissingen en veiligheidskritische code vereisen nog steeds het volledige redeneervermogen van het hoofdmodel. Ook brengt delegatie een lichte netwerkvertraging met zich mee, waardoor het omleiden van zeer kleine bestanden niet efficiënt is.
De benodigde modi en de Shunt-plugin zijn beschikbaar via de spotify/portal-ai-plugins marketplace voor organisaties die gebruikmaken van Portal by Spotify.