concepto · intermedio · 2 min de lectura
Context Window
La context window es la cantidad máxima de tokens que un LLM puede procesar en una sola solicitud, determinando cuánta información puede tener en cuenta simultáneamente.
No requiere conocimientos previos.
Alcance en breve
Cubre
- Context Window as a concept
No cubre
- implementation details
Supone
- The reader understands relevant fundamentals.
Resumen
La context window —ventana de contexto— define cuántos tokens puede recibir y recordar un LLM en una conversación. Si la ventana es de 128K tokens y tu conversación acumula 200K, el modelo "olvida" los primeros 72K tokens. Todo lo que querés que el modelo sepa debe caber en esa ventana.
Las ventanas crecieron exponencialmente: GPT-2 (1K) → GPT-3 (4K) → GPT-4 (128K) → Gemini (1M-2M). Una ventana más grande permite procesar documentos completos, codebases enteros y conversaciones muy largas, pero tiene costo computacional cuadrático (O(n²) en atención).
Alcance y supuestos
Cubre context window, su evolución y estrategias para maximizar su uso. Asume familiaridad con LLMs.
Modelo mental
Tu memoria de corto plazo en una conversación. Si hablás 3 horas con alguien, no recordás textualmente lo que dijo en el minuto 5. La context window es el equivalente: el modelo solo recuerda lo que cabe en la ventana.
Uso práctico
- ✅ Elegir un modelo con ventana suficiente para tu caso de uso.
- ✅ Usar RAG para traer información externa en vez de meterla toda en la ventana.
- ❌ Asumir que una ventana de 1M tokens significa que el modelo "entiende" todo por igual.
Ejemplo trabajado: ventana en acción
Con 4K tokens, un resumen de un paper de 10 páginas no cabe. Con 128K, cabe el paper entero más instrucciones detalladas.
Evidencia
- La context window es una de las especificaciones más importantes al elegir un modelo. Claude 3 ofrece 200K; Gemini 1.5 Pro, 2M.
Fuentes citadas
- Wikipedia, Object-oriented programming (Síntesis, 21-07-2026)