Als je de afgelopen maanden intensief met AI hebt gewerkt, ben je ongetwijfeld deze frustrerende melding tegengekomen. Je bent midden in een belangrijke taak voor je werk en plotseling stopt de chatbot ermee. Je hebt je gebruikslimiet bereikt. Of je nu werkt met ChatGPT, Claude of een andere tool, de onderliggende oorzaak is altijd hetzelfde. Je tokens zijn op.
Tokens zijn in korte tijd geëvolueerd van een obscuur technisch detail op de achtergrond naar de belangrijkste beperking en factureringseenheid voor moderne AI-modellen. Begrijpen hoe AI jouw invoer leest, een antwoord genereert, door moeilijke problemen nadenkt en kosten opbouwt, komt allemaal terug op dit ene concept. Wij leggen je precies uit hoe het werkt en hoe je als thuiswerker meer gedaan krijgt zonder direct tegen je limieten aan te lopen.
Wat zijn tokens in AI precies
Tokens zijn de fundamentele leeselementen van tekst voor moderne AI-modellen. Wanneer je een uitgebreide prompt typt of een document uploadt, ziet de AI geen letters, woorden of zinnen zoals wij die zien. Het model ziet een lange reeks van tokens. Dit is ook exact de manier waarop de AI zijn antwoord weer aan jou teruggeeft.
Er is geen universele omrekening van tokens naar tekens, maar een handige vuistregel die wij vaak hanteren is dat één token ongeveer gelijk staat aan vier tekens of driekwart van een gemiddeld woord. Hoe dit wordt opgedeeld, verschilt sterk. Veelvoorkomende woorden zoals ‘de’ of ‘en’ krijgen een eigen, enkel token. Langere of zeldzame woorden worden opgesplitst in meerdere kleine tokens. Een lange URL in je tekst kan zo maar veertien tokens in beslag nemen.
Belangrijk om te beseffen is dat ook spaties, emoji’s en leestekens meetellen. Het woord ’thuiswerken’ met of zonder een spatie ervoor, wordt door de tokenizer als twee totaal verschillende eenheden gezien. Hoe efficiënter jij je tekst opbouwt, des te minder tokens je verbruikt. Dit inzicht helpt je direct bij het praktisch inzetten van AI op je thuiswerkplek.
Denk als een AI: elk token telt. Slimme prompts en efficiënt contextbeheer optimaliseren je budget.
— Jordy de Wolde
Hoe taalmodellen jouw tekst genereren
Het klinkt bijna te simpel voor de complexe taken die we eraan uitbesteden, maar grote taalmodellen genereren tekst door simpelweg het meest logische volgende token in een reeks te voorspellen. Ze doen dit één voor één, totdat het volledige antwoord is gevormd.
Geef je de prompt ‘er was eens een…’, dan berekent het model razendsnel dat het volgende token waarschijnlijk ’tijd’ of ‘man’ zal zijn. Om een compleet rapport of een stuk programmeercode te schrijven, blijft het model continu het volgende stukje voorspellen op basis van alles wat er daarvoor is geschreven. Al het diepe onderzoek, de foutloze e-mails en de strakke codeeringsscripts zijn gebouwd op dit fundamentele principe van waarschijnlijkheidsberekening.
Omdat het genereren van nieuwe output veel meer rekenkracht vereist dan het simpelweg lezen van jouw input, maken AI-bedrijven een strikt onderscheid tussen input-tokens en output-tokens. Output kost het systeem meer energie, waardoor deze tokens zwaarder wegen in je limiet of letterlijk duurder zijn wanneer je per verzoek betaalt.
Het contextvenster verklaart waarom AI soms dingen vergeet
Al die tokens moeten ergens worden opgeslagen tijdens jullie gesprek. Jouw prompt, de hele gespreksgeschiedenis, de bestanden die je hebt geüpload en de antwoorden die de AI heeft gegeven, vormen samen de context. Het contextvenster is het maximale aantal tokens dat een model in één keer kan vasthouden en verwerken.
Vroege modellen hadden een zeer beperkt contextvenster. Dit is de reden dat de AI halverwege een lang gesprek plotseling cruciale details uit je eerste prompt leek te vergeten. Het oude gedeelte van het gesprek werd letterlijk uit het geheugen geduwd om plaats te maken voor nieuwe tokens.
Tegenwoordig bieden de krachtigste modellen contextvensters van honderdduizenden of zelfs miljoenen tokens. Dit is groot genoeg om een compleet boekwerk of een gigantische dataset in te laden. Toch is het belangrijk hier slim mee om te gaan. Als jij een PDF van honderd pagina’s uploadt, moet de AI die volledige PDF bij elke nieuwe vraag die jij stelt opnieuw door het contextvenster halen. Dit verbrandt je dagelijkse token-budget in een razend tempo. Verwijder dus grote bestanden uit je chat zodra je de benodigde antwoorden hebt verzameld.
Aanbevolen producten
Waarom redeneermodellen je limiet zo snel opslokken
Sinds kort hebben we toegang tot geavanceerde redeneermodellen, ook wel 'reasoning models' genoemd. Deze modellen genereren eerst een interne denkketen voordat ze antwoord geven op je prompt. Ze werken verschillende oplossingsrichtingen uit en bekijken het probleem van meerdere kanten om tot een superieur antwoord te komen, in plaats van direct het eerste woord te raden.
Deze denkfase is extreem nuttig voor complexe bedrijfsproblemen, data-analyses en het schrijven van ingewikkelde code. Het nadeel is dat dit onzichtbare denkproces enorm veel tokens verbruikt. Soms schrijft een model intern duizenden tokens aan denkwerk voordat het überhaupt één woord van het uiteindelijke antwoord op je scherm toont. Je raakt je limiet dus veel sneller kwijt.
Voor een eenvoudige samenvatting van een vergadering of het herschrijven van een e-mail naar een vriendelijkere toon, heb je absoluut geen redeneermodel nodig. Bespaar je tokens door voor simpele taken terug te schakelen naar snellere, goedkopere modellen binnen de huidige generatie ChatGPT of Claude omgevingen.
De verborgen kosten van dagelijks AI gebruik
Tokens vormen de exacte meter waarmee jouw AI-gebruik wordt berekend. Waar we voorheen met vaste abonnementen werkten waarbij de grenzen wat diffuus waren, zijn we in een echte token-economie beland. Voor grote bedrijven die betalen per API-verzoek, tikt onzorgvuldig token-gebruik keihard door in de portemonnee. Een team van ontwikkelaars dat constant enorme contextvensters vollaadt, kan onbedoeld duizenden euro's per maand aan AI-kosten genereren.
Maar ook voor jou als individuele thuiswerker met een vast pro-abonnement blijft dit relevant. Het bepaalt namelijk direct wanneer jij die vervelende blokkade op je scherm krijgt. Het lezen van je lange prompt telt mee, het interne redeneren telt zwaar mee, en het genereren van het uiteindelijke antwoord telt mee. Als je dit mechanisme eenmaal begrijpt, snap je precies waarom die paar snelle vragen over een groot Excel-bestand ineens je hele middaglimiet hebben verbruikt.
Slimmer omgaan met tokens door automatisering
De meest effectieve manier om tokenverspilling tegen te gaan, is door AI alleen in te zetten voor taken die daadwerkelijk intelligentie vereisen. Voor het simpelweg verplaatsen van data van app A naar app B, of het sorteren van standaard e-mails, heb je geen zware taalmodellen nodig. Hiervoor kun je beter traditionele automatisering gebruiken.
Platformen zoals Zapier laten je bedrijfsprocessen automatiseren waarbij je zelf de controle houdt over welke stappen via AI verlopen en welke stappen volgens vaste regels werken. Je kunt bijvoorbeeld instellen dat inkomende leads automatisch in je CRM worden gezet (kost nul tokens), waarna een licht en goedkoop AI-model snel bepaalt in welke categorie de lead valt (kost een fractie van een cent). Alleen de complexe vragen van belangrijke klanten stuur je vervolgens door naar een zwaar redeneermodel.
Door bewust te kiezen welk model je voor welke taak inzet en je dagelijkse werk deels te automatiseren met tools als Zapier, bespaar je niet alleen op token-kosten of irritante limieten, maar versnel je ook je eigen werkdag aanzienlijk.
Haal meer uit je digitale werkdag
We zullen de komende jaren steeds bewuster moeten leren omgaan met ons token-verbruik. Net zoals je leert om je fysieke thuiswerkplek ergonomisch in te richten voor de lange termijn, is 'context management' de nieuwe vaardigheid voor je digitale werkplek. Hou je prompts beknopt, laad geen gigantische bestanden in als je slechts een specifiek deel nodig hebt, en schakel zware denkmodellen alleen in wanneer het probleem dat echt rechtvaardigt. Zo zorg je ervoor dat je AI-assistent altijd voor je klaarstaat, precies op de momenten dat je hem het hardst nodig hebt.








