Saltar al contenido
Explorar conocimiento

concepto · intermedio · 1 min de lectura

Multimodalidad

La multimodalidad permite a un modelo procesar y generar múltiples tipos de datos —texto, imágenes, audio, video— de forma integrada.

No requiere conocimientos previos.

Alcance en breve

Cubre

  • Multimodalidad as a concept

No cubre

  • implementation details

Supone

  • The reader understands relevant fundamentals.

Resumen

Un modelo multimodal —GPT-4V, Gemini, Claude 3— no solo entiende texto: puede ver imágenes, escuchar audio y, en algunos casos, generar imágenes o video. La multimodalidad se logra típicamente encodeando cada modalidad en un espacio común de embeddings donde texto, imagen y audio comparten la misma representación.

Esto permite interacciones como "describí esta imagen", "transcribí este audio y resumilo", o "generá una imagen a partir de esta descripción". La fusión temprana (early fusion) mezcla modalidades desde el input; la fusión tardía (late fusion) procesa cada modalidad por separado y combina outputs.

Alcance y supuestos

Cubre multimodalidad como concepto y su implementación en LLMs modernos. Asume familiaridad con Transformers.

Modelo mental

Una persona que puede leer un libro, mirar una foto y escuchar una canción, y después explicarte cómo se relacionan. No procesa cada cosa por separado en compartimentos estancos: integra todo en una comprensión unificada.

Uso práctico

  • ✅ Asistentes que entienden el mundo visual además del textual.
  • ❌ Modelos multimodales requieren más datos de entrenamiento y cómputo que los unimodales.

Ejemplo trabajado: GPT-4V

Usuario sube la foto de un plato roto y pregunta "¿cómo puedo arreglar esto?". GPT-4V ve la imagen, identifica el material y sugiere el pegamento adecuado.

Evidencia

  • GPT-4V, Gemini 1.5, Claude 3 y LLaVA son los modelos multimodales más conocidos.

Fuentes citadas