Qué es exactamente un token
Un token es la unidad mínima de texto con la que trabaja un modelo de lenguaje grande (LLM). No es una palabra, no es un carácter y no es una sílaba, aunque puede coincidir con cualquiera de los tres según el caso. Es el resultado de dividir el texto mediante un algoritmo llamado tokenizador, que parte el texto en fragmentos que el modelo puede procesar como unidades numéricas.
La razón de existir de los tokens es matemática: los modelos de lenguaje no entienden texto. Trabajan con números. Cada token se convierte en un número (un ID) que el modelo procesa internamente. El tokenizador es el puente entre el texto humano y los vectores numéricos que el modelo realmente manipula.
Regla aproximada para inglés:
1 token ≈ 4 caracteres ≈ ¾ de palabra
100 tokens ≈ 75 palabras
1.000 tokens ≈ 750 palabras ≈ 1,5 páginas de texto estándar
Estas son aproximaciones para inglés. Como veremos más adelante, el español y otros idiomas latinos consumen más tokens por palabra, lo que tiene implicaciones directas en el coste.
Cómo se divide el texto en tokens: el tokenizador
El algoritmo más usado actualmente para tokenizar texto en LLMs es BPE (Byte Pair Encoding), desarrollado originalmente para compresión de datos y adaptado para el procesamiento de lenguaje natural. La idea básica es construir un vocabulario de subpalabras a partir de los patrones más frecuentes en un corpus de entrenamiento enorme.
El resultado es que las palabras comunes en inglés suelen ser un solo token, las palabras menos frecuentes se dividen en varios fragmentos, y los caracteres especiales, números y signos de puntuación tienen su propio tratamiento:
Ejemplos de tokenización (GPT-4 / tiktoken):
"hello" → [hello] → 1 token
"ChatGPT" → [Chat] [G] [PT] → 3 tokens
"tokenization" → [token] [ization] → 2 tokens
"supercalifragilístico" → [super] [cal] [ifr] [ag] [il] [ís] [tico] → 7 tokens
"2026" → [2] [0] [2] [6] → 4 tokens (los números suelen tokenizarse dígito a dígito)
" " (tres espacios) → [ ] [ ] [ ] → 3 tokens
Nótese que los espacios en blanco también consumen tokens. Un prompt con indentación excesiva, muchos saltos de línea innecesarios o espacios redundantes está pagando tokens por caracteres que no aportan información al modelo.
Los tokens en español son más caros que en inglés
Este es uno de los puntos menos conocidos pero más relevantes para usuarios hispanohablantes: el español consume entre un 20 y un 40 % más de tokens que el inglés para transmitir el mismo contenido. La razón está en cómo se construyó el vocabulario del tokenizador.
Los tokenizadores de los principales modelos (GPT, Claude, Gemini) se entrenaron con corpus donde el inglés domina ampliamente. Como resultado, las palabras frecuentes en inglés están representadas como tokens únicos, mientras que palabras igualmente comunes en español —pero menos frecuentes en el corpus de entrenamiento— se dividen en múltiples subtokens.
Comparativa inglés vs. español (misma idea):
"The artificial intelligence changes the world" → ~7 tokens
"La inteligencia artificial cambia el mundo" → ~8–9 tokens
"Please summarize the following document" → ~7 tokens
"Por favor resume el siguiente documento" → ~9–10 tokens
En un uso puntual la diferencia es insignificante. Pero en aplicaciones que procesan miles o millones de peticiones al día, ese 20–40 % extra de tokens se traduce directamente en un 20–40 % más de coste. Es una de las razones por las que los equipos de desarrollo que trabajan con APIs de IA a menudo escriben sus system prompts en inglés aunque el producto final sea en otro idioma.
Calculadora relacionada
Estima cuántos tokens tiene tu texto y cuánto costaría en cada modelo
Calcular ahoraLa ventana de contexto: por qué el modelo "olvida"
Cada modelo tiene un límite máximo de tokens que puede procesar en una sola llamada: la ventana de contexto. Todo lo que entra en esa ventana —el system prompt, el historial de la conversación y el mensaje actual— cuenta hacia ese límite. Cuando la conversación supera la ventana, el modelo no puede acceder a los mensajes más antiguos: los "olvida".
Ventanas de contexto aproximadas (mid-2026):
GPT-4o: 128.000 tokens ≈ unas 300 páginas de texto
Claude Sonnet: 200.000 tokens ≈ unas 450 páginas
Gemini 1.5 Pro: 1.000.000 tokens ≈ unas 1.400 páginas
Modelos pequeños (GPT-3.5, versiones básicas): 4.000–16.000 tokens
La ventana de contexto también explica por qué incluir documentos enteros en el prompt tiene un coste real: si pegas un PDF de 50 páginas como contexto, estás consumiendo decenas de miles de tokens antes de que el modelo escriba una sola palabra de respuesta. En la API, esos tokens de entrada se cobran igual que los de salida (o en algunos modelos, a un precio menor pero no despreciable).
Una práctica habitual para optimizar el uso de la ventana de contexto es el context pruning: eliminar partes del historial de conversación que ya no son relevantes para el intercambio actual, en lugar de acumular todo el hilo desde el principio.
Cómo se cobra: tokens de entrada vs. tokens de salida
Las APIs de los principales modelos cobran por separado los tokens que entran (input) y los que genera el modelo como respuesta (output). Los tokens de salida suelen ser entre 2 y 5 veces más caros que los de entrada, porque generarlos requiere más cómputo que leerlos.
Esquema de precios típico (orientativo, mid-2026):
Modelo económico (ej. GPT-4o mini): ~$0,15 / millón tokens entrada · ~$0,60 / millón tokens salida
Modelo estándar (ej. GPT-4o): ~$2,50 / millón tokens entrada · ~$10 / millón tokens salida
Modelo premium (ej. Claude Opus): ~$15 / millón tokens entrada · ~$75 / millón tokens salida
Ejemplo de coste real:
Prompt de 500 tokens + respuesta de 800 tokens usando GPT-4o:
Entrada: 500 × ($2,50 / 1.000.000) = $0,00125
Salida: 800 × ($10 / 1.000.000) = $0,008
Total por llamada: ≈ $0,009 (menos de un céntimo)
Pero si haces 100.000 llamadas similares al día: ≈ $900/día
La conclusión práctica es que a pequeña escala el coste por token es irrelevante. A escala de producto o empresa, optimizar los tokens —prompts más concisos, respuestas más cortas cuando no se necesitan largas, elección del modelo adecuado para cada tarea— puede suponer diferencias de miles de euros al mes.
Cómo reducir el uso de tokens sin perder calidad
Si usas la API con frecuencia o estás construyendo una aplicación, estas prácticas reducen el consumo de tokens sin sacrificar la calidad de las respuestas:
En el system prompt: sé directo y elimina cortesías innecesarias. "Eres un asistente útil y amable que siempre intenta ayudar al usuario de la mejor manera posible respondiendo con detalle y precisión" usa el doble de tokens que "Responde de forma concisa y precisa". El modelo no necesita adjetivos para comportarse bien.
En el historial de conversación: no incluyas mensajes anteriores que ya no son relevantes. Si el usuario preguntó algo hace 20 turnos que no afecta a la respuesta actual, elimínalo del contexto que envías.
En documentos de referencia: en lugar de pegar el documento completo, extrae solo los párrafos relevantes. Un sistema de recuperación (RAG) puede hacer esto automáticamente.
En el formato de salida: si no necesitas respuestas en Markdown, pide texto plano. Los asteriscos, almohadillas y guiones de formato también son tokens.
En la elección de modelo: no uses el modelo más potente para tareas simples. Clasificar un texto en tres categorías no necesita GPT-4o; un modelo pequeño lo hace igual de bien a una fracción del coste.
Entender los tokens no es solo una cuestión técnica: es entender cómo piensan y procesan información los modelos de lenguaje. Saber que el modelo trabaja con fragmentos de texto de longitud variable, que el español cuesta más que el inglés por token, que la ventana de contexto tiene un límite duro y que la generación es más cara que la lectura te convierte en un usuario más eficiente, sea que uses estas herramientas de forma personal o las integres en un producto.