Glosario · IA y automatización

Context window / Tokenización

Un token equivale aproximadamente a 4 caracteres en inglés (menos en español por el uso de subwords). El context window es la cantidad máxima de tokens (entrada + salida) que un modelo procesa por petición. Cada modelo tiene su propio límite, que cambia con las versiones: conviene consultarlo en la documentación del proveedor.

Qué es y cómo funciona

Un modelo de lenguaje no lee letras ni palabras completas, sino tokens: fragmentos de texto que pueden ser una palabra corta, parte de una palabra larga o un signo de puntuación. El número de tokens de un texto depende del idioma y del tokenizador de cada modelo, así que no hay una equivalencia exacta; como orientación, un texto en español suele necesitar más tokens por palabra que uno equivalente en inglés.

La ventana de contexto es el máximo de tokens que el modelo puede manejar en una misma petición. Dentro de ella entran todas las instrucciones, el historial de la conversación, los documentos que adjuntes y la respuesta que genere. Lo que no cabe se descarta o debe resumirse. El modelo no tiene memoria entre peticiones: si parece que recuerda una conversación, es porque la aplicación reenvía el historial cada vez.

El tamaño de la ventana varía entre modelos y cambia con cada versión, así que conviene consultarlo en la documentación del proveedor en el momento de elegir. Que quepa mucho texto no significa que el modelo lo aproveche igual de bien: con contextos muy largos puede perder precisión al recuperar datos concretos.

Por qué importa

Los tokens son la unidad en la que la mayoría de los proveedores cobran, y también influyen en la latencia: cuanto más texto envías, más caro y más lenta suele ser la respuesta. Diseñar bien qué entra en el contexto, en lugar de enviarlo todo, reduce costes y mejora los resultados.

Es también una de las razones de ser de RAG: en vez de meter todos tus documentos en la petición, recuperas solo los fragmentos pertinentes. Y cuenta para la privacidad, porque todo lo que incluyes en la ventana se envía al proveedor, así que conviene decidir qué datos entran y cuáles no.

Un ejemplo

Una empresa construye un asistente para resolver dudas sobre contratos. Al principio envía el contrato completo y todo el historial en cada mensaje; las conversaciones largas empiezan a fallar y el coste crece. Rediseñan el sistema para enviar solo las cláusulas relevantes y un resumen de lo hablado hasta el momento. La respuesta mejora y el consumo de tokens baja, aunque el resumen puede omitir algún detalle, por lo que se revisa con casos reales.

Errores y confusiones frecuentes

  • Creer que una ventana grande hace innecesario organizar la información. Más contexto implica más coste y latencia, y puede diluir lo importante entre mucho texto irrelevante.
  • Dar por hecho que el modelo recuerda conversaciones pasadas. Si la aplicación no reenvía o resume el historial, el modelo no lo conoce; y cuando se resume, se pierde parte del detalle.
  • Calcular costes por palabras o por caracteres. Se miden en tokens, que varían entre modelos e idiomas; estima el consumo con el tokenizador del proveedor y con textos reales en español.
Dudas habituales

Preguntas frecuentes sobre Context window

No hay una cifra fija. Depende del idioma, de la palabra y del tokenizador del modelo. Las palabras comunes suelen ser un solo token, y las largas o poco frecuentes se parten en varios. Para saberlo con precisión, usa la herramienta de recuento del proveedor.

Según el proveedor y la aplicación, la petición falla o se recorta el contenido más antiguo. Lo prudente es controlar el tamaño antes de enviar, resumir el historial y recuperar solo los fragmentos necesarios en lugar de enviar documentos enteros.

¿Necesitas aplicarlo en tu proyecto?

Cuéntanos qué quieres conseguir y te decimos, sin compromiso, si Context window tiene sentido en tu caso o si hay una opción mejor.