Contador de tokens aproximado
Contador de tokens aproximado: estima tokens con caracteres, palabras y una regla transparente de cuatro caracteres.
Tres medidas distintas del texto
Pega cualquier fragmento y la página informa caracteres, palabras y tokens estimados. Los caracteres se cuentan como puntos de código; las palabras son grupos separados por espacios; la tercera cifra se obtiene con ceil(caracteres / 4). Cada medida responde a una regla diferente.
La estimación de tokens
Dividir entre cuatro ofrece una aproximación rápida, no una tokenización del modelo. Un token real puede ser una palabra corta, parte de una palabra, puntuación o espacios según el vocabulario usado. Idioma, emojis, código y números cambian mucho la relación entre caracteres y tokens.
Ejemplo comprobable
El texto «Contar tokens ayuda a estimar contexto.» contiene 39 caracteres contados por la herramienta, seis palabras separadas por espacios y una estimación de ceil(39/4), es decir, aproximadamente 10 tokens. Otro tokenizador puede devolver una cantidad distinta.
Caracteres Unicode y palabras
Contar puntos de código evita tratar cada unidad UTF-16 como carácter independiente, pero un emoji compuesto puede contener varios puntos de código. La regla de palabras tampoco entiende guiones o idiomas sin espacios: se limita a dividir el texto recortado por espacios consecutivos.
Usar el dato con límites de modelos
Para decidir si una petición cabe en una ventana de contexto, consulta el tokenizador y el límite del modelo exacto. Incluye también instrucciones del sistema, historial y salida prevista. Esta cifra aproximada sirve para una primera orientación, no para cortar texto en un límite estricto.
Si debes reducir un documento, no borres caracteres solo hasta que esta estimación coincida con el máximo. Reserva espacio para la respuesta y vuelve a medir con la herramienta oficial. Tablas, código y cadenas sin espacios pueden consumir tokens de un modo muy distinto a un párrafo corriente de longitud parecida.
Comparar versiones de un borrador
La misma fórmula sí permite una comparación aproximada dentro de textos parecidos. Si una versión baja de 8.000 a 6.000 caracteres, la estimación reflejará esa reducción relativa. No la conviertas en un coste monetario sin conocer el tokenizador, tarifas, caché y categorías de entrada y salida del proveedor concreto.
Fuentes y referencias
Continúa con estas herramientas
- Generador de Hashtags
- Generador de gráficos desde CSV
- Contador de Caracteres
- Eliminar Duplicados
- Generador Lorem Ipsum
Preguntas frecuentes
¿Cuenta tokens reales de GPT, Claude o Gemini?
No. Aplica una fórmula general de un token por cada cuatro caracteres y no carga vocabularios de modelos.
¿Cómo cuenta las palabras?
Recorta el texto y separa grupos por uno o más espacios en blanco.
¿Por qué un emoji puede contar como varios caracteres?
Algunos emojis combinan varios puntos de código, como tono de piel, género o selector de variación.
¿La puntuación se considera palabra aparte?
No si está pegada a una palabra; la división se basa en espacios, no en análisis lingüístico.
¿Puedo usar la estimación para un límite exacto?
No es seguro. Usa el tokenizador oficial del modelo y deja margen para instrucciones y respuesta.
¿Qué devuelve un campo vacío?
Cero caracteres, cero palabras y una estimación de cero tokens.
Herramienta de OCC Tools