Saltar al contenido

Contador de Tokens LLM + Costo

Tokens y costo USD para Claude / GPT / Gemini / Llama / Mistral

100% Gratis Sin registro Solo navegador 5 idiomas Modo oscuro

⚠ 2026-04 Anthropic · OpenAI · Google

caracteres
0
Palabras
0
CJK
0
Líneas
0

📐 Método

  • • ASCII: ~4 chars / token (promedio de BPE de GPT)
  • • CJK: ~1.5 tokens / char (tanto GPT como Claude)
  • • Exacto ±10-20%
Modelo Entrada Salida In $/MT Out $/MT Costo Ctx Uso

📖 Dónde se suele tropezar

Pega texto y esto estima el número de tokens y el coste aproximado en los modelos principales. Todo se ejecuta en el navegador. Son estimaciones: cada proveedor lleva su propio tokenizador y la misma frase puede variar en torno a un diez por ciento entre modelos. Cuando necesites cifras exactas, usa la API oficial de conteo de tokens del proveedor. Esta pantalla sirve para comprobar que no te has equivocado de orden de magnitud.

Caso Qué ocurre Qué hacer
Estimar el coste del japonés con intuición inglesa El inglés va a unos cuatro caracteres por token, mientras que el japonés, el chino y el coreano van a uno o dos tokens por carácter. Para el mismo número de caracteres eso son de cinco a ocho veces más tokens. Presupuesta con un prompt en inglés y luego cambia al japonés, y la factura sale varias veces mayor de lo previsto. Mide con texto real en el idioma que vas a usar. Toma los tokens de entrada y salida de una petición y multiplícalos por tus peticiones mensuales antes de decidir. Para abaratar, traducir los datos al inglés suele ser peor que escribir sólo la instrucción en inglés y dejar la entrada en su idioma original: la instrucción es idéntica en cada petición, así que acortarla rinde en todas.
Presupuestar sólo con los tokens de entrada Los tokens de salida suelen costar entre tres y cinco veces los de entrada. Resumir un documento largo sale barato porque la entrada es grande y la salida pequeña; generar texto largo desde una instrucción corta deja casi toda la factura del lado de la salida, aunque la entrada sean unas decenas de tokens. En una conversación, la trampa añadida es que todo el historial viaja como entrada en cada turno. Estima entrada y salida por separado, multiplica cada una por su tarifa y súmalas. Si la longitud de salida es impredecible, ponle tope con max_tokens y presupuesta con ese tope para quedarte del lado seguro. En conversaciones, envía los últimos N turnos o un resumen acumulado en vez del historial completo, y así el recuento deja de crecer con el número de turnos.
Creer que basta con que quepa en la ventana Que quepa y que se use bien son cosas distintas. Dentro de una entrada larga, se observa una y otra vez que el material del medio recibe menos atención que el del principio o el final: el efecto lost in the middle. Además, llenar la ventana sube tanto el coste por petición como la latencia. Pon la instrucción importante al final de la entrada. Pegar el material primero y escribir después la instrucción es más fiable que al revés. Cuando el documento es grande, ese es el momento de dejar de pasarlo entero y recuperar sólo las partes relevantes; la parte de troceado está en el troceador de texto para RAG.

Si envías el mismo contenido en cada petición, comprueba si aplica el caché de prompts. Cachear la parte inicial que no cambia entre peticiones —un prompt de sistema, un documento de referencia— reduce mucho la tarifa de entrada de esa parte. Aprovecharlo exige estructurar el prompt con lo invariable al principio, así que conviene diseñarlo así desde el inicio en vez de reescribirlo después. Las tarifas y condiciones varían por modelo: consulta la página de precios del proveedor.

📖 Cómo usar

  1. 1
    Pega texto
    Pega a la izquierda
  2. 2
    Salida + opciones
    Tokens salida + opciones
  3. 3
    Compara
    Costo + ctx

❓ Preguntas frecuentes

¿Preciso?
Aproximado ±10-20%
¿Precios cuándo?
2026-04
¿Batch / caché?
Batch 50% / caché 10%
🐛 ¿Encontró un problema con esta herramienta?

Gratis, sin registro. Incluso solo los pasos para reproducir ayudan. Los informes van directamente al operador y se usan para corregir.

* Se envía automáticamente la info del navegador (UA / pantalla / idioma / URL) para reproducir