O que é um token
Modelos de linguagem não leem letras nem palavras: eles leem tokens, pedaços de texto que podem ser uma palavra inteira, parte dela ou um sinal. Em inglês, um token tem em média uns 4 caracteres; em português e espanhol os tokens são menores, porque os tokenizadores foram treinados com mais texto em inglês.
Como estimamos
O contador divide o número de caracteres pela média de caracteres por token de cada tokenizador e idioma:
| Tokenizador | Português | Espanhol | Inglês | Código |
|---|---|---|---|---|
| GPT-5.6 | 3,6 | 3,7 | 4,2 | 3,3 |
| Claude 5.x (Opus, Sonnet, Fable) | 2,55 | 2,6 | 2,9 | 2,4 |
| Claude Haiku 4.5 | 3,3 | 3,4 | 3,8 | 3,1 |
Os modelos Claude a partir da versão 4.7 usam um tokenizador novo que gera cerca de 30% mais tokens para o mesmo texto, segundo a própria Anthropic. Por isso o mesmo prompt "pesa" mais no Opus 5.5 que no Haiku 4.5.
Quando precisar do número exato
A estimativa fica dentro de ±15% para textos comuns. Para cobrança exata, as duas APIs devolvem a contagem real em cada resposta (campo usage), e a Anthropic tem um endpoint gratuito de contagem de tokens antes de enviar.
O texto colado aqui não sai do seu navegador.