Saltar al contenido
Explorar conocimiento

concepto · intermedio · 4 min de lectura

Modelos

Un modelo de IA es un conjunto de parámetros entrenados que transforma entradas en salidas. Elegir el modelo adecuado requiere equilibrar capacidad, costo, latencia y restricciones de despliegue.

No requiere conocimientos previos.

Alcance en breve

Cubre

  • models as trained parameter sets that transform inputs to outputs
  • LLMs, embedding models, multimodal, and specialized models
  • model size, architecture (dense vs MoE), context window, and quantization
  • practical trade-offs: capability, latency, cost, and deployment constraints

No cubre

  • detailed training and fine-tuning procedures
  • transformer architecture internals in depth
  • specific pricing models of providers

Supone

  • The reader understands basic software engineering and has a high-level idea of what an LLM does.

Resumen

Un modelo de IA es el resultado de entrenar un algoritmo con datos para que pueda realizar una tarea específica. En términos prácticos, es un archivo que contiene parámetros numéricos aprendidos (pesos) y una arquitectura que define cómo se organizan. Cuando envías una entrada al modelo, este la procesa a través de su arquitectura y produce una salida.

Existen modelos para diferentes propósitos: modelos de lenguaje (LLMs) que generan y entienden texto, modelos de embeddings que convierten contenido en vectores, modelos multimodales que procesan texto e imágenes, y modelos especializados para clasificación, traducción, síntesis de voz, etc.

Alcance y supuestos

Este paquete cubre qué es un modelo de IA, los tipos principales (LLMs, embedding, multimodal, clasificación), cómo el tamaño y la arquitectura afectan capacidad y costo, y las decisiones prácticas al elegir un modelo para un producto.

No cubre el entrenamiento detallado de modelos, fine-tuning, arquitecturas transformer en profundidad, ni pricing específico de proveedores. Asume que entiendes conceptos básicos de software y tienes una idea general de lo que hace un LLM.

Modelo mental

Piensa en un modelo como una función matemática enorme. Recibe una entrada (texto, imagen, números), la transforma a través de muchas capas de operaciones, y produce una salida. No "entiende" el significado de lo que procesa; ha aprendido patrones estadísticos de sus datos de entrenamiento.

Un modelo más grande (más parámetros) puede aprender patrones más complejos, pero también es más costoso de entrenar y ejecutar, más lento, y requiere más memoria. Un modelo más pequeño es más rápido y barato, pero captura menos matices. No hay modelo "mejor" en abstracto — solo el que mejor equilibra las restricciones de tu problema.

Uso práctico

Usa el modelo adecuado según la tarea:

  • ✅ LLM grande para razonamiento complejo, generación de código, análisis.
  • ✅ Modelo embedding para búsqueda semántica y RAG.
  • ✅ Modelo multimodal cuando necesitas procesar imágenes junto con texto.
  • ✅ Modelo pequeño (quantizado) para despliegue en edge o baja latencia.
  • ❌ No uses un LLM enorme si una regla simple o un modelo pequeño basta.
  • ❌ No uses un embedding genérico si tu dominio requiere uno especializado.

Ejemplo trabajado: elegir modelo para un clasificador de soporte

Supón que necesitas clasificar tickets de soporte en 5 categorías. Tienes tres opciones:

interface ModelOption {
  name: string;
  params: string;
  latency: string;
  costPerRequest: string;
  accuracy: string;
}

Opción A — LLM grande (GPT-4, Claude 4):

  • Alta precisión, pero 2-5 segundos por request y costo ~30x más que una alternativa.

Opción B — Modelo de clasificación fine-tuned (BERT):

  • Buena precisión si tienes datos etiquetados, latencia de ~100ms, costo bajo.

Opción C — Embeddings + clasificador simple (kNN o regresión logística):

  • Precisión decente sin fine-tuning, latencia ~200ms, sin GPU necesaria en inferencia.
const options: ModelOption[] = [
  { name: "LLM grande", params: ">100B", latency: "2-5s", costPerRequest: "alta", accuracy: "95%" },
  { name: "BERT fine-tuned", params: "110M", latency: "100ms", costPerRequest: "baja", accuracy: "92%" },
  { name: "Embeddings + kNN", params: "-", latency: "200ms", costPerRequest: "muy baja", accuracy: "88%" },
];

Para un MVP, embeddings + kNN pueden ser suficientes. Si necesitas precisión y tienes datos, fine-tuning es el mejor equilibrio. Solo si las categorías cambian constantemente y necesitas razonamiento complejo, el LLM grande se justifica.

Evidencia

Fuentes citadas