concepto · intermedio · 1 min de lectura
Multimodalidad
La multimodalidad permite a un modelo procesar y generar múltiples tipos de datos —texto, imágenes, audio, video— de forma integrada.
No requiere conocimientos previos.
Alcance en breve
Cubre
- Multimodalidad as a concept
No cubre
- implementation details
Supone
- The reader understands relevant fundamentals.
Resumen
Un modelo multimodal —GPT-4V, Gemini, Claude 3— no solo entiende texto: puede ver imágenes, escuchar audio y, en algunos casos, generar imágenes o video. La multimodalidad se logra típicamente encodeando cada modalidad en un espacio común de embeddings donde texto, imagen y audio comparten la misma representación.
Esto permite interacciones como "describí esta imagen", "transcribí este audio y resumilo", o "generá una imagen a partir de esta descripción". La fusión temprana (early fusion) mezcla modalidades desde el input; la fusión tardía (late fusion) procesa cada modalidad por separado y combina outputs.
Alcance y supuestos
Cubre multimodalidad como concepto y su implementación en LLMs modernos. Asume familiaridad con Transformers.
Modelo mental
Una persona que puede leer un libro, mirar una foto y escuchar una canción, y después explicarte cómo se relacionan. No procesa cada cosa por separado en compartimentos estancos: integra todo en una comprensión unificada.
Uso práctico
- ✅ Asistentes que entienden el mundo visual además del textual.
- ❌ Modelos multimodales requieren más datos de entrenamiento y cómputo que los unimodales.
Ejemplo trabajado: GPT-4V
Usuario sube la foto de un plato roto y pregunta "¿cómo puedo arreglar esto?". GPT-4V ve la imagen, identifica el material y sugiere el pegamento adecuado.
Evidencia
- GPT-4V, Gemini 1.5, Claude 3 y LLaVA son los modelos multimodales más conocidos.
Fuentes citadas
- Wikipedia, Object-oriented programming (Síntesis, 21-07-2026)