Qué es un token
Los modelos de lenguaje no leen letras ni palabras: leen tokens, fragmentos de texto que pueden ser una palabra entera, parte de ella o un signo. En inglés un token tiene en promedio unos 4 caracteres; en español los tokens son más cortos porque los tokenizadores se entrenaron con más texto en inglés.
Cómo estimamos
El contador divide el número de caracteres por el promedio de caracteres por token de cada tokenizador e idioma:
| Tokenizador | Portugués | Español | Inglés | Código |
|---|---|---|---|---|
| GPT-5.6 | 3.6 | 3.7 | 4.2 | 3.3 |
| Claude 5.x (Opus, Sonnet, Fable) | 2.55 | 2.6 | 2.9 | 2.4 |
| Claude Haiku 4.5 | 3.3 | 3.4 | 3.8 | 3.1 |
Los modelos Claude desde la versión 4.7 usan un tokenizador nuevo que genera cerca de 30% más tokens para el mismo texto, según Anthropic. Por eso el mismo prompt "pesa" más en Opus 5.5 que en Haiku 4.5.
Cuando necesite el número exacto
La estimación queda dentro de ±15% en textos comunes. Ambas API devuelven el conteo real en cada respuesta (campo usage), y Anthropic ofrece un endpoint gratuito para contar tokens antes de enviar.
El texto que pega aquí no sale de su navegador.