Saltar al contenido
Explorar conocimiento

concepto · intermedio · 2 min de lectura

Context Window

La context window es la cantidad máxima de tokens que un LLM puede procesar en una sola solicitud, determinando cuánta información puede tener en cuenta simultáneamente.

No requiere conocimientos previos.

Alcance en breve

Cubre

  • Context Window as a concept

No cubre

  • implementation details

Supone

  • The reader understands relevant fundamentals.

Resumen

La context window —ventana de contexto— define cuántos tokens puede recibir y recordar un LLM en una conversación. Si la ventana es de 128K tokens y tu conversación acumula 200K, el modelo "olvida" los primeros 72K tokens. Todo lo que querés que el modelo sepa debe caber en esa ventana.

Las ventanas crecieron exponencialmente: GPT-2 (1K) → GPT-3 (4K) → GPT-4 (128K) → Gemini (1M-2M). Una ventana más grande permite procesar documentos completos, codebases enteros y conversaciones muy largas, pero tiene costo computacional cuadrático (O(n²) en atención).

Alcance y supuestos

Cubre context window, su evolución y estrategias para maximizar su uso. Asume familiaridad con LLMs.

Modelo mental

Tu memoria de corto plazo en una conversación. Si hablás 3 horas con alguien, no recordás textualmente lo que dijo en el minuto 5. La context window es el equivalente: el modelo solo recuerda lo que cabe en la ventana.

Uso práctico

  • ✅ Elegir un modelo con ventana suficiente para tu caso de uso.
  • ✅ Usar RAG para traer información externa en vez de meterla toda en la ventana.
  • ❌ Asumir que una ventana de 1M tokens significa que el modelo "entiende" todo por igual.

Ejemplo trabajado: ventana en acción

Con 4K tokens, un resumen de un paper de 10 páginas no cabe. Con 128K, cabe el paper entero más instrucciones detalladas.

Evidencia

  • La context window es una de las especificaciones más importantes al elegir un modelo. Claude 3 ofrece 200K; Gemini 1.5 Pro, 2M.

Fuentes citadas