Skip to content

Guide

Ventana de contexto: por qué fallan los prompts largos

Una ventana de contexto es un presupuesto de tokens estricto, no una sugerencia flexible — y el modo de fallo al superarlo no siempre es un error.

By Published

Todo modelo de lenguaje grande alojado tiene un límite fijo de cuántos tokens puede leer en una llamada: la ventana de contexto. Suena como un límite sencillo — quédate por debajo y listo— pero dos cosas hacen tropezar a casi cualquiera que construya sobre una API: qué cuenta realmente para ese número, y qué pasa cuando lo superas. Puedes comprobar exactamente cómo encaja un prompt dado frente a la ventana de cada modelo principal con el visualizador de ventana de contexto.

Qué cuenta para la ventana

Todo lo que el modelo lee antes de empezar a escribir cuenta: el prompt de sistema, cada turno anterior en una conversación de varios turnos, los esquemas de herramientas y funciones pasados al modelo, los documentos recuperados en un pipeline RAG, y el último mensaje del usuario. Nada de eso es opcional o gratuito — un prompt de sistema largo repetido en cada llamada de una app de chat es una fuente común y fácil de pasar por alto de desbordamiento, porque es invisible en la interfaz pero se reenvía completo en cada solicitud.

La salida se factura y se limita por separado, con su propio techo que suele ser mucho menor que la propia ventana de contexto. Un modelo que anuncia una ventana de contexto muy grande aun así solo puede emitir un número modesto de tokens por respuesta — los dos números responden preguntas distintas y no deben confundirse.

Qué ocurre realmente al desbordar

El modo de fallo no es uniforme entre proveedores, lo que en parte explica por qué es fácil equivocarse en producción:

  • Rechazo directo. La mayoría de las llamadas directas a la API que superan el límite de tokens documentado devuelven un error explícito que indica el recuento de tokens de la solicitud frente al límite del modelo. Es el modo de fallo más seguro porque es evidente e inmediato.
  • Truncado silencioso.Algunos envoltorios de cliente e interfaces de chat, en cambio, eliminan los mensajes más antiguos del historial de conversación para que la siguiente llamada quepa, sin indicar que se eliminó algo. El modelo entonces responde como si nunca hubiera visto el contexto eliminado — lo que puede parecer que el modelo “olvida” instrucciones o datos que, en realidad, fueron recortados en silencio.

Ninguno de los dos modos de fallo es algo que quieras descubrir en producción. Dimensionar el prompt frente a la ventana antes de enviarlo — o incorporar la comprobación en tu pipeline— es el hábito más fiable, y es exactamente lo que hace el visualizador de ventana de contexto con un prompt pegado: muestra el porcentaje de ocupación por modelo y marca en rojo cuando superas aproximadamente el 80% de utilización.

Que quepa no es lo mismo que leerse bien

Un prompt que cabe cómodamente dentro de la ventana puede seguir produciendo respuestas peores que uno más corto. La investigación independiente sobre contexto largo ha documentado un efecto de “perdido en el medio”: los modelos recuerdan la información situada cerca del inicio o el final de un prompt largo con más fiabilidad que la información enterrada en el medio, incluso cuando todo el prompt está muy por debajo del límite de tokens. No es un fallo del modelo de un proveedor en concreto — aparece en distintas arquitecturas y es una propiedad de cómo se degrada la atención en secuencias muy largas.

La implicación práctica: trata “¿cabe?” y “¿lo usará bien el modelo?” como dos preguntas separadas. Para cargas de trabajo intensivas en recuperación, un conjunto más pequeño de fragmentos bien elegidos colocados cerca de los bordes del prompt a menudo supera a un volcado máximo que técnicamente cabe pero entierra el pasaje importante en el medio.

Estimar tokens sin un tokenizador completo

Para un dimensionamiento rápido, aproximadamente 4 caracteres por token para prosa en inglés y más cerca de 3,5 para código denso es suficiente para planificar — esa heurística es la que usan tanto el contador de tokens como el visualizador. Para una cifra en la que puedas confiar antes de lanzar algo a producción — o antes de dar el visto bueno a una estimación de coste—, pasa el mismo texto por el propio tokenizador del proveedor, ya que cada proveedor usa un esquema de tokenización distinto y el recuento exacto difiere entre ellos incluso para el mismo texto. Una vez que conoces el recuento de tokens, la calculadora de coste de LLM lo convierte en un precio por llamada.

Frequently asked questions

¿Qué es exactamente una ventana de contexto?
El número máximo de tokens de entrada que un modelo puede leer en una sola llamada — el prompt de sistema, el historial de la conversación, los esquemas de herramientas, los documentos recuperados y el último mensaje del usuario cuentan todos. Es independiente del límite de salida, que limita cuántos tokens puede generar el modelo en su respuesta.
¿Qué pasa si mi prompt supera la ventana de contexto?
Depende del proveedor. La mayoría de las API rechazan la solicitud directamente con un error que indica el número de tokens y el límite. Algunas librerías cliente o interfaces de chat, en cambio, truncan en silencio los turnos más antiguos de una conversación para hacer sitio, lo que puede eliminar instrucciones o contexto que el modelo necesitaba — a menudo peor que un error, porque nada te avisa de que ocurrió.
¿Usar menos de la ventana completa garantiza una buena salida?
No. Que quepa dentro de la ventana solo significa que el modelo puede leerlo técnicamente todo — no significa que preste la misma atención a todo. La investigación sobre modelos de contexto largo documenta un efecto de «perdido en el medio»: la información situada en medio de un prompt largo se recuerda con menos fiabilidad que la del inicio o el final, incluso muy por debajo del límite de tokens.
¿Cómo cuento tokens antes de enviar una solicitud?
Aproximadamente, la prosa en inglés ronda los 4 caracteres por token y el código denso más cerca de 3,5, suficiente para decisiones de tamaño. Para un recuento exacto, usa el propio tokenizador del proveedor del modelo (tiktoken de OpenAI, el endpoint count-tokens de Anthropic, count_tokens de Google) — cada proveedor usa un tokenizador distinto, así que el mismo texto produce recuentos exactos diferentes entre modelos.

Sources & references

Authoritative references cited by this piece. Verified by Buğra Sözeri on the dates shown and re-checked at every deploy.

Related

Published September 25, 2026