Token Counter
Een taalmodel rekent niet in woorden maar in tokens, en het verschil is groter dan mensen verwachten: Nederlandse tekst kost per woord meer tokens dan Engelse, en code, JSON en emoji vallen weer heel anders uit. Deze tool telt lokaal met dezelfde OpenAI-encodings — cl100k_base voor GPT-3.5 en GPT-4, o200k_base voor GPT-4o en nieuwer — en niet met de veelgebruikte vuistregel van vier tekens per token. Je ziet niet alleen het aantal, maar ook hoe je tekst in losse tokenstukken uiteenvalt. Laad ook eenvoudig een tekstbestand zoals TXT, Markdown, JSON of CSV; het bestand verlaat je browser niet. Handig om te controleren of een prompt binnen het contextvenster past, om twee formuleringen tegen elkaar af te wegen, of om vooraf een kosteninschatting te maken. Voor Anthropic en Google is de uitkomst een indicatie, omdat zij eigen tokenizers gebruiken. Het gebruik is gratis en onbeperkt, ook zakelijk — geen account, geen licentie, geen limiet op het aantal keren.
Waar je dit voor gebruikt
- Controleren of een systeemprompt binnen het contextvenster past
- Twee formuleringen vergelijken op tokenkosten
- Vooraf inschatten wat een batch van duizend documenten kost
Wat anderen van deze tool vinden
Nog geen beoordelingen voor deze tool. Die van jou is de eerste.
Werk je met Westcube?
Laat ook een review achter op GoogleVeelgestelde vragen
Is dit het exacte aantal tokens van mijn AI-model?
Voor OpenAI-modellen die de gekozen encoding gebruiken: ja, exact. Dit is dezelfde tokenizer-bibliotheek die OpenAI zelf publiceert, geen benadering. Kies cl100k_base voor GPT-3.5 en GPT-4, en o200k_base voor GPT-4o en nieuwere modellen. Voor andere aanbieders is het een indicatie: Anthropic en Google gebruiken elk een eigen tokenizer, en die komt op dezelfde tekst op een ander aantal uit. In de praktijk zit het voor gewone lopende tekst binnen ongeveer tien procent van elkaar, wat voor een kosteninschatting ruim voldoende is, maar reken er niet mee af tot op het token.
Hoeveel tokens is een woord ongeveer?
De vuistregel die je overal leest — ongeveer vier tekens per token, of driekwart woord per token — klopt redelijk voor Engelse lopende tekst en veel minder goed voor de rest. Nederlands valt duurder uit omdat samenstellingen als "verzekeringsmaatschappij" in meerdere stukken worden geknipt waar het Engels een enkel token gebruikt. Code, JSON en URL’s vallen ook ongunstig uit door alle leestekens. Emoji en niet-Latijns schrift kunnen meerdere tokens per teken kosten. Precies daarom is tellen zinvoller dan schatten, zeker als je met een krap contextvenster of een groot volume werkt.
Wordt mijn tekst naar een AI-aanbieder gestuurd?
Nee. De tekst wordt volledig in je browser verwerkt en gaat niet naar onze server, OpenAI of een andere AI-aanbieder. Ook tekst uit een lokaal geladen bestand blijft lokaal.
Zit er een maximum aan de tekstlengte?
Ja, vijftigduizend tekens per keer. Dat is ruim: het is grofweg een document van vijftien tot twintig pagina’s, en meer dan genoeg voor vrijwel elke prompt. De grens zit er om te voorkomen dat één aanvraag de server minutenlang bezet houdt. Heb je een groter document, knip het dan in stukken en tel die op — tokenizen is nagenoeg optelbaar, met hooguit een verschil van enkele tokens op de knippunten. Er is geen dagcap en geen betaalde variant met een hogere limiet.
Tellen input- en outputtokens allebei mee voor de kosten?
Ja, en dat wordt vaak vergeten. Aanbieders rekenen input en output apart af, waarbij output meestal een stuk duurder is per token — bij sommige modellen een factor vier of vijf. Deze tool telt wat je erin stopt. Voor een volledige kostenraming tel je daar het verwachte antwoord bij op, en bij een gesprek met meerdere beurten ook de hele voorgeschiedenis die telkens opnieuw wordt meegestuurd. Dat laatste is de meest onderschatte kostenpost in een chattoepassing.