IA para Científicos Sociales

Sesión 4.1: Entendiendo los LLMs

Danilo Freire

Department of Data and Decision Sciences
Emory University

Repaso del Día 3

Aprendizaje no supervisado

  • K-means y clustering jerárquico: agrupar sin etiquetas
  • PCA: reducir dimensiones preservando varianza

Texto como datos

  • Tokenización por palabras, stopwords, bag-of-words
  • TF-IDF: identificar vocabulario distintivo
  • Embeddings con Word2Vec: las palabras como vectores

Hoy: extendemos esa idea

Word2Vec ya hacía algo notable: aprender que palabras similares tienen vectores cercanos, sin etiquetas, solo prediciendo contexto

Los LLMs hacen lo mismo, a escala masiva:

  • Predicen tokens en lugar de palabras
  • Usan atención para decidir qué contexto importa
  • Trabajan con cientos de miles de millones de parámetros

El resultado: traducción, resumen, razonamiento, conversación. Todo con una sola idea aplicada a escala

Agenda del Día 4

Sesión 4.1 (esta clase)

Cómo funcionan los LLMs por dentro

  • La gran idea: predicción del próximo token
  • Cómo procesa el texto (tokens, embeddings, contexto)
  • Atención y arquitectura transformer
  • Escala, emergencia y alucinaciones
  • El ecosistema actual

Sesión 4.2

Cómo usar los LLMs en investigación

  • Alucinaciones en detalle (caso real)
  • Cuatro defensas: prompts, salida estructurada, RAG, validación
  • Anotación y datos sintéticos
  • APIs accesibles (OpenRouter, Ollama) y ellmer

Laboratorios 7 y 8: práctica con LLMs desde R

La única idea: predicción del próximo token

¿Qué es un LLM?

  • LLM = Large Language Model (modelo de lenguaje extenso)
  • Un modelo de IA entrenado con cantidades masivas de texto para predecir el próximo token
  • El “large” se refiere a tres dimensiones:
    • Parámetros: GPT-3 tiene 175 mil millones; GPT-4 se estima en más de 1 billón
    • Datos: terabytes de texto (Wikipedia, libros, código, web)
    • Cómputo: meses de entrenamiento con miles de GPUs
  • La idea es conceptualmente simple. La magia viene de la escala
  • A esa escala emergen capacidades que no fueron programadas: traducir, resumir, responder preguntas, escribir código

El pipeline de un LLM

La predicción del próximo token

  • Dada una secuencia, el modelo calcula una distribución de probabilidad sobre todos los tokens posibles del vocabulario
  • Ejemplo: “El gato se sentó en la ___”
Token Probabilidad
alfombra 0,28
silla 0,15
mesa 0,12
cama 0,09
ventana 0,04
  • El modelo muestrea un token (típicamente uno de los más probables, con algo de aleatoriedad)
  • Luego repite el proceso con el nuevo contexto

¡Eso es todo lo que hace! 🤖

Sin búsqueda, sin razonamiento explícito, sin “comprensión” como la entendemos los humanos

Solo estadísticas sobre tokens, computadas con una arquitectura muy potente, sobre datos masivos

Nota

Cuando ChatGPT genera una respuesta de 200 palabras, está haciendo esta predicción unas 300 veces seguidas

La generación es iterativa

  • Cada paso usa el contexto completo (entrada + lo generado hasta ahora) para predecir el siguiente token

Paso 1: “El gato se sentó en la **___**” → “alfombra”

Paso 2: “El gato se sentó en la alfombra **___**” → “porque”

Paso 3: “El gato se sentó en la alfombra porque **___**” → “estaba”

Paso 4: “El gato se sentó en la alfombra porque estaba **___**” → “caliente”

  • Un token a la vez, siempre mirando todo el contexto previo
  • Por eso los LLMs pueden equivocarse a mitad de un párrafo y arrastrar el error
  • También por eso responden de forma fluida: cada token nuevo se construye sobre los anteriores

Cómo procesa el texto

Tokens: ni letras ni palabras

  • Los LLMs no leen letras ni palabras: leen tokens, que son subpalabras
  • Algoritmo más común: BPE (Byte Pair Encoding; Sennrich, Haddow y Birch, 2016)
  • Vocabulario finito (típicamente 50.000 a 200.000 tokens) que puede representar casi cualquier texto
  • Palabras comunes son un solo token; palabras raras o largas se descomponen

Ejemplos (tokenizador de OpenAI)

  • “hola” → 1 token
  • “ChatGPT” → 3 tokens (Chat, G, PT)
  • “investigación” → 3 tokens
  • “Latinoamérica” → 5 tokens
  • “paralelepípedo” → 6 tokens

Byte Pair Encoding

Fuente: OpenAI Tokenizer (GPT 3)

BPE: cómo se aprenden los tokens

  • La intuición del algoritmo:
    1. Empezar con caracteres individuales como vocabulario inicial
    2. Contar los pares más frecuentes (por ejemplo, “e” + “n” en español)
    3. Fusionar el par más frecuente en un nuevo token (“en”)
    4. Repetir hasta llegar al tamaño de vocabulario deseado
  • Resultado: tokens que reflejan la estadística del idioma de entrenamiento
  • Una palabra rara como “anticonstitucionalmente” se descompone en partes pequeñas
  • Una palabra común como “de” es un solo token

Regla práctica

Para inglés: 100 tokens ≈ 75 palabras

Para español: 100 tokens ≈ 55 palabras

Las tildes, la ñ y los acentos añaden tokens. Una respuesta de 1000 palabras en español puede consumir 1800 tokens

Esto importa para el costo y para la ventana de contexto

Nota

El vocabulario de BPE se aprende sobre el corpus de entrenamiento. Si el corpus es mayoritariamente inglés, el español necesita más tokens para decir lo mismo

Tokens en español: una consideración práctica

  • Los modelos comerciales fueron entrenados mayoritariamente con texto en inglés
  • Implicaciones prácticas para investigación en América Latina:
    • Los prompts en español cuestan más por la misma cantidad de información
    • Las respuestas también consumen más tokens
  • Estrategias:
    • Para tareas simples: usar inglés en el system prompt y español en los datos
    • Para investigación: medir el costo por documento antes de escalar
    • Para corpus grandes: considerar modelos entrenados con más español (Mistral, Qwen)
  • Modelos chinos y europeos (Qwen, Mistral) tienen tokenizadores más eficientes para lenguas no anglófonas

Costo por token

Si su corpus es grande y en español, el costo se acumula rápido. Mediciones tempranas evitan sorpresas

Ventana de contexto

  • La ventana de contexto es el número máximo de tokens que el modelo puede procesar en una sola llamada
  • Incluye entrada y salida: prompt + respuesta
  • La ventana ha crecido enormemente en pocos años:
Modelo Ventana Equivalente en español
GPT-3 (2020) 2K ~1.000 palabras
GPT-3.5 (2022) 16K ~9.000 palabras
GPT-4o (2024) 128K ~70.000 palabras
Claude Sonnet 4.6, GPT-5.5 (2026) 1M ~550.000 palabras
Grok 4.1 Fast (2026) 2M ~1,1 millones de palabras
  • Implicación: hoy cabe un artículo académico completo en el contexto. Una novela también. Una colección entera de documentos, muchas veces no

Ventana de contexto

Fuente: Anthropic

Costo y rendimiento crecen con el tamaño del contexto. Más contexto no siempre es mejor

Embeddings: vectores con significado

  • Cada token se convierte en un vector de números
  • Estos vectores capturan significado semántico:
    • Palabras similares → vectores cercanos
    • “rey” − “hombre” + “mujer” ≈ “reina” (Mikolov et al., 2013)
  • Es la misma idea que vimos con Word2Vec ayer, pero ahora con dimensiones mucho mayores:
    • Word2Vec: ~300 dimensiones por palabra
    • GPT-2: 768 dimensiones por token
    • GPT-4: miles de dimensiones
  • Los embeddings se aprenden durante el entrenamiento: nadie los programa explícitamente
  • Aplicaciones: búsqueda semántica, clasificación, recomendaciones, RAG

Palabras en un espacio vectorial

Fuente: TensorFlow Embedding Projector

Los embeddings forman un espacio semántico: regiones del espacio corresponden a temas, sentimientos, dominios

Embeddings contextuales: el salto

Word2Vec (estático)

  • Una palabra → un único vector
  • “banco” tiene siempre el mismo embedding, sin importar el contexto
  • Limitación: no distingue homónimos ni ambigüedad
  • Promedio entre todos los usos

Ejemplo:

“banco financiero” y “banco del parque” usan el mismo vector para “banco”.

LLM (contextual)

  • Una palabra → un vector distinto en cada contexto
  • “banco” en una frase de finanzas ≠ “banco” en una frase de paseo
  • El embedding se calcula mirando todo el contexto
  • Permite resolver ambigüedad de forma natural

Ejemplo:

“banco financiero” produce un vector cercano a “economía”, “dinero”. “banco del parque” produce un vector cercano a “asiento”, “madera”.

Atención y arquitectura

¿Qué le faltaba a Word2Vec?

  • Word2Vec aprendía con una ventana fija de 5 palabras antes y 5 después
  • Tres limitaciones serias:
    1. Ventana corta: no captura relaciones de largo alcance dentro del texto
    2. Peso uniforme: todas las palabras de la ventana cuentan igual, sin importar cuáles son relevantes
    3. Sin contexto en el vector: la representación de cada palabra es la misma en cualquier oración
  • Estas limitaciones son comunes a todos los métodos clásicos: bag-of-words, TF-IDF, LDA, Word2Vec

Nota

Cuando un modelo trata “no es bueno” como bag-of-words, pierde la negación. La atención permite que “no” pondere lo que viene después

¿Qué necesitamos?

Un mecanismo que, para cada token nuevo, decida cuáles tokens previos importan y los pondere en consecuencia

Esa es la innovación de los transformers

Atención = ponderación dinámica del contexto

La atención: pondera el contexto

  • Para cada token, el modelo computa una puntuación de relevancia con todos los tokens previos
  • Luego usa esas puntuaciones para ponderar la información que llega a ese token
  • Ejemplo de resolución de ambigüedad:

“La gata se sentó en la alfombra porque estaba caliente.”

Para saber qué estaba caliente, el modelo computa atención desde “estaba”:

  • estaba → “gata”: 0,05
  • estaba → “alfombra”: 0,72
  • estaba → “porque”: 0,11
  • estaba → otros: 0,12
  • El modelo “resuelve” que lo caliente era la alfombra y no la gata, porque la atención lo pondera así

Mapa de atención

Fuente: Jay Alammar

Cada celda muestra cuánto un token presta atención a otro

Multi-cabeza: varios tipos de “qué importa”

  • Una sola cabeza de atención solo captura un tipo de relación a la vez
  • Los transformers usan atención multi-cabeza: varios mecanismos de atención en paralelo dentro de la misma capa
  • Cada cabeza aprende un patrón distinto:
    • Una cabeza puede aprender sintaxis (sujeto-verbo)
    • Otra puede aprender co-referencia (pronombres → antecedentes)
    • Otra puede aprender relaciones semánticas (causa-consecuencia)
  • GPT-4 tiene docenas de cabezas por capa, y docenas de capas
  • En total: miles de patrones aprendidos en paralelo

Nota

Las primeras capas tienden a aprender gramática. Las últimas, semántica y razonamiento. Es lo que sugieren los estudios de interpretabilidad

El transformer en una diapositiva

  • El transformer (del paper Attention is all you need, Vaswani et al., 2017) combina todos los ingredientes:
    1. Tokenizar: texto → tokens
    2. Embeber: tokens → vectores (con posición)
    3. Atender: cabezas múltiples ponderan el contexto
    4. Procesar: red feed-forward refina la representación
    5. Predecir: el próximo token más probable
  • Los pasos 3 y 4 se repiten en muchas capas apiladas:
    • GPT-2: 12 capas
    • GPT-3: 96 capas
    • GPT-4: estimado 120+ capas
  • Cada capa va construyendo una representación más abstracta del texto

Arquitectura del transformer

Fuente: Jay Alammar

Nota

Recurso interactivo: Transformer Explainer permite ver cada paso con un modelo pequeño

La escala y sus consecuencias

La escala lo cambia todo

Un parámetro es como un coeficiente de regresión: un número que el modelo aprende de los datos. Un LLM tiene miles de millones.

Word2Vec (2013) GPT-3 (2020) GPT-4 (2023)
Parámetros ~300 millones 175 mil millones ~1 billón (estimado)
Datos de entrenamiento Wikipedia (GB) 570 GB de texto Petabytes
Tokens vistos Millones 300 mil millones ~13 billones
Costo estimado Horas de GPU ~USD 4 millones ~USD 100 millones
Tiempo de entrenamiento Días Semanas Meses


  • El salto de Word2Vec a GPT-3 fue de tres órdenes de magnitud en parámetros
  • El salto de GPT-3 a GPT-4 fue de otro orden de magnitud
  • A cada escala emergen capacidades nuevas que no estaban en el modelo más pequeño
  • Solo las grandes empresas (OpenAI, Google, Anthropic, Meta, xAI) pueden entrenar modelos de frontera. Nosotros usamos los modelos pre-entrenados

Emergencia: capacidades nuevas a escala

  • A escalas pequeñas, los modelos solo predicen tokens sensatamente
  • A escalas suficientemente grandes, aparecen capacidades nuevas:
    • Traducción entre idiomas sin entrenamiento específico
    • Resumen de textos largos
    • Razonamiento paso a paso
    • Aritmética básica
    • Programación en muchos lenguajes
    • Conversación coherente y útil
  • No hay un punto fijo: cada capacidad emerge a una escala distinta
  • Esto se llama emergencia y es debatido: ¿es real o artefacto de medición? (Schaeffer et al., 2023)

Una capacidad emergente que nos interesa

In-context learning: el modelo “aprende” de los ejemplos que le damos en el prompt, sin actualizar sus pesos

Esto solo funciona a escala suficiente. Modelos pequeños no lo logran

Lo veremos a continuación 😉

In-context learning: few-shot sin entrenamiento

El experimento

Dar al modelo unos pocos ejemplos en el prompt:

Traduce al inglés:
- gato → cat
- perro → dog
- casa → house
- libro →

Sin entrenamiento, sin actualizar pesos. Solo le pasamos los ejemplos en el contexto. El modelo continúa el patrón:

- libro → book

Por qué importa

  • Permite adaptar el modelo a tareas nuevas sin reentrenar
  • Funciona para clasificación, anotación, extracción, traducción
  • Es la base del prompt engineering
  • Es una capacidad emergente: modelos pequeños no la tienen

Comparación

Enfoque Datos necesarios
Entrenar un clasificador ~1000 ejemplos
Fine-tuning de LLM ~100 ejemplos
In-context learning 3 a 10 ejemplos

Pero esto también falla: alucinaciones

  • Recuerden lo que el modelo optimiza:

\[P(\text{próximo token} \mid \text{contexto previo})\]

  • NO optimiza:

\[P(\text{afirmación verdadera})\]

  • El modelo no tiene acceso a hechos, solo a patrones estadísticos del texto de entrenamiento
  • Si una secuencia de palabras suena plausible (un nombre, una fecha, una cita), el modelo la genera, aunque sea falsa
  • Las alucinaciones son comunes en:
    • Citas académicas, estadísticas, hechos históricos, etc

Tasas de alucinación de los 25 modelos con mejor desempeño

Fuente: Vectara Hallucination Leaderboard (julio de 2026)

El modelo resume un documento que le dan, y se cuenta cuántas veces agrega datos que no están en ese documento. Aun con la fuente a la vista, del 2% al 7% de los resúmenes inventan algo

Teaser: el abogado de Nueva York

  • 2023: un abogado en Nueva York usa ChatGPT para preparar un escrito legal

  • Le pide al modelo precedentes para apoyar su caso (Mata vs. Avianca)

  • ChatGPT genera seis casos con citas completas: nombres, números de expediente, argumentos

  • El abogado los incluye en su escrito

  • Ninguno de los seis casos existe

  • El juez lo descubre. Multa: USD 5.000. Vergüenza pública. Caso de estudio internacional

  • Otros casos: Air Canada - engaño (The Guardian, 2024), Google Bard - errores (Reuters, 2023), ChatGPT - difamación (Reuters, 2023), EY - citas falsas (FT, 2026)

El caso del abogado

Fuente: CNN

El ecosistema actual

Modelos cerrados (comerciales)

Modelo Empresa Contexto Costo (entrada) Acceso
GPT-5.5 OpenAI ~1M ~USD 5/M tokens API
GPT-5 mini OpenAI 400K ~USD 0,25/M tokens API
Claude Opus 4.8 Anthropic 1M ~USD 5/M tokens API
Claude Sonnet 4.6 Anthropic 1M ~USD 3/M tokens API
Gemini 2.5 Pro Google 1M ~USD 1,25/M tokens API
Grok 4.3 xAI 1M ~USD 1,25/M tokens API

Precios y versiones de junio de 2026; el mercado cambia rápido, conviene verificar los valores actuales


  • Pros: mejor calidad disponible, contexto grande, multimodal, no requieren hardware propio
  • Cons: cuestan dinero, requieren tarjeta de crédito, son cajas negras (no pueden inspeccionarlos), pueden cambiar entre versiones
  • Para investigación reproducible: registrar siempre el modelo y la fecha

Modelos abiertos y locales

  • Modelos con pesos disponibles: cualquiera puede descargarlos y correrlos
  • Pueden ejecutarse localmente en una computadora con suficiente RAM
  • Buena herramienta: Ollama (ollama pull granite4.1:3b y listo)

Principales modelos abiertos

Modelo Empresa Tamaños
Llama 4 Meta Scout, Maverick
Qwen 3.5 Alibaba 4B a 235B
DeepSeek V4 DeepSeek 671B MoE (~22B activos)
Mistral Large 3 Mistral AI 675B MoE (~41B activos)
Gemma 4 Google chicos a medianos

Ventajas

  • Cero costo, privacidad, reproducibilidad

Limitaciones

  • Calidad por debajo de los cerrados de frontera (mejorando rápido)
  • Necesitan RAM significativa: 8 GB para modelos chicos, 40+ GB para los grandes
  • Los modelos muy grandes (Llama 405B) no corren en laptops

Por qué caben igual

  • MoE: activan solo parte de sus parámetros por token
  • Cuantización: menos precisión (16→4 bits) baja la RAM

Volveremos a Ollama mañana, en la sesión de aplicaciones

Multimodal: las imágenes también son tokens

  • Una imagen es una grilla de píxeles: cada uno, tres números (rojo, verde, azul)
  • Una foto típica son millones de números sin significado por sí solos
  • Un Vision Transformer la corta en parches (por ejemplo, de 16×16 píxeles)
  • Cada parche se trata como un token y se convierte en un embedding, igual que una palabra
  • Desde ahí, el transformer usa atención exactamente como con el texto
  • Por eso un modelo puede ver: afiches, memes, documentos escaneados, PDFs
  • Lo hacen GPT-5.5, Claude Opus 4.8 y Gemini 2.5

Una imagen vale 16×16 palabras

La imagen se parte en parches; cada parche es un token

Fuente: Dosovitskiy et al. (2020)

Multimodal: el sonido se vuelve una imagen

  • El sonido es una onda que cambia en el tiempo. No se ve
  • El truco: convertirla en un espectrograma, una imagen de sus frecuencias
  • Y una imagen ya sabemos volverla tokens: parches → embeddings
  • El espectrograma pasa por el mismo transformer: atención y tokens, igual que el texto
  • Así funciona Whisper (OpenAI): transcribe habla en 99 idiomas
  • Por eso un modelo puede oír: transcribir entrevistas, discursos o audios de campo
  • Y el video no es nada nuevo: son imágenes + sonido, así que también entra

Nota

Idea clave: texto, imagen y sonido terminan siendo el mismo tipo de números (embeddings). Por eso un solo modelo puede con todo

De onda a espectrograma

Arriba la onda; abajo, el mismo sonido como imagen

Fuente: Bäckström et al. (2026)

Resumen de la sesión

Siete ideas para llevarse:

  1. Un LLM es un predictor del próximo token, entrenado a escala masiva
  2. Procesa el texto como subpalabras (tokens, BPE), con una ventana de contexto finita
  3. Los embeddings de los LLMs son contextuales, a diferencia de Word2Vec
  4. La atención es el mecanismo que permite ponderar qué contexto importa para cada token
  5. La escala (parámetros, datos, cómputo) produce capacidades emergentes como el in-context learning
  6. El mismo mecanismo que da fluidez (predicción de tokens, no de verdad) produce alucinaciones
  7. Imagen, audio y video también son procesados por LLMs multimodales, con aplicaciones para investigación social

Próximos pasos

  • Sesión 4.2: LLMs como herramientas de investigación
    • Las cuatro defensas: prompts, salida estructurada, RAG, validación
    • Anotación automática y datos sintéticos
    • APIs accesibles (OpenRouter, Ollama) y los paquetes ellmer y quallmer en R
  • Laboratorios 7 y 8:
    • Configurar ellmer con OpenRouter (gratis) desde R
    • Prompts con PTCF y clasificación con few-shot
    • Codificación cualitativa con quallmer: definir un codebook y validar
    • Comparación con los métodos clásicos del día 3

¡Nos vemos en la próxima sesión! 🤓

Nos vemos en unos minutos 😉