concepto · intermedio · 1 min de lectura
Tokenización
La tokenización divide el texto en unidades más pequeñas —tokens— que el modelo puede procesar, convirtiendo palabras o subpalabras en números.
No requiere conocimientos previos.
Alcance en breve
Cubre
- Tokenización as a concept
No cubre
- implementation details
Supone
- The reader understands relevant fundamentals.
Resumen
Antes de que un LLM pueda procesar texto, debe convertirlo en números. La tokenización divide el texto en tokens —palabras, subpalabras o caracteres— y asigna a cada uno un ID numérico de un vocabulario fijo. "Hola, ¿cómo estás?" → ["Hola", ",", "¿", "cómo", "estás", "?"] → [1234, 5, 67, 890, 123, 45].
Los tokenizadores modernos (BPE, WordPiece, SentencePiece) usan subpalabras: "tokenización" → ["token", "ización"]. Esto permite manejar palabras nuevas sin aumentar el vocabulario. El tokenizer de GPT usa ~50K tokens; el de LLaMA ~32K.
Alcance y supuestos
Cubre tokenización, BPE, y su impacto en los LLMs. Asume familiaridad con conceptos de NLP.
Modelo mental
Un cocinero que recibe una receta en inglés y la traduce a un sistema numérico que su cocina entiende. "Cup of flour" → [ingrediente:42, cantidad:1, unidad:3]. La tokenización es esa traducción: convierte texto en números que la red neuronal puede procesar.
Uso práctico
- ✅ Todo LLM usa tokenización. Elegir el tokenizer correcto afecta la eficiencia y el soporte multilingüe.
- ❌ Un tokenizador mal entrenado genera más tokens de los necesarios, desperdiciando contexto.
Ejemplo trabajado: BPE en acción
"playing" → ["play", "ing"]. "played" → ["play", "ed"]. El tokenizer aprende que "play" y los sufijos "ing"/"ed" son unidades reutilizables.
Evidencia
- BPE (Byte Pair Encoding) fue popularizado por GPT-2. SentencePiece es usado por LLaMA y T5.
Fuentes citadas
- Wikipedia, Object-oriented programming (Síntesis, 21-07-2026)