Sesión 4.1: Entendiendo los LLMs
Aprendizaje no supervisado
Texto como datos
Hoy: extendemos esa idea
Word2Vec ya hacía algo notable: aprender que palabras similares tienen vectores cercanos, sin etiquetas, solo prediciendo contexto
Los LLMs hacen lo mismo, a escala masiva:
El resultado: traducción, resumen, razonamiento, conversación. Todo con una sola idea aplicada a escala
Sesión 4.1 (esta clase)
Cómo funcionan los LLMs por dentro
Sesión 4.2
Cómo usar los LLMs en investigación
ellmerLaboratorios 7 y 8: práctica con LLMs desde R
| Token | Probabilidad |
|---|---|
| alfombra | 0,28 |
| silla | 0,15 |
| mesa | 0,12 |
| cama | 0,09 |
| ventana | 0,04 |
| … | … |
¡Eso es todo lo que hace! 🤖
Sin búsqueda, sin razonamiento explícito, sin “comprensión” como la entendemos los humanos
Solo estadísticas sobre tokens, computadas con una arquitectura muy potente, sobre datos masivos
Nota
Cuando ChatGPT genera una respuesta de 200 palabras, está haciendo esta predicción unas 300 veces seguidas
Paso 1: “El gato se sentó en la **___**” → “alfombra”
Paso 2: “El gato se sentó en la alfombra **___**” → “porque”
Paso 3: “El gato se sentó en la alfombra porque **___**” → “estaba”
Paso 4: “El gato se sentó en la alfombra porque estaba **___**” → “caliente”
…
Ejemplos (tokenizador de OpenAI)
Chat, G, PT)Fuente: OpenAI Tokenizer (GPT 3)
Regla práctica
Para inglés: 100 tokens ≈ 75 palabras
Para español: 100 tokens ≈ 55 palabras
Las tildes, la ñ y los acentos añaden tokens. Una respuesta de 1000 palabras en español puede consumir 1800 tokens
Esto importa para el costo y para la ventana de contexto
Nota
El vocabulario de BPE se aprende sobre el corpus de entrenamiento. Si el corpus es mayoritariamente inglés, el español necesita más tokens para decir lo mismo
| Modelo | Ventana | Equivalente en español |
|---|---|---|
| GPT-3 (2020) | 2K | ~1.000 palabras |
| GPT-3.5 (2022) | 16K | ~9.000 palabras |
| GPT-4o (2024) | 128K | ~70.000 palabras |
| Claude Sonnet 4.6, GPT-5.5 (2026) | 1M | ~550.000 palabras |
| Grok 4.1 Fast (2026) | 2M | ~1,1 millones de palabras |
Fuente: Anthropic
Costo y rendimiento crecen con el tamaño del contexto. Más contexto no siempre es mejor
Fuente: TensorFlow Embedding Projector
Los embeddings forman un espacio semántico: regiones del espacio corresponden a temas, sentimientos, dominios
Word2Vec (estático)
Ejemplo:
“banco financiero” y “banco del parque” usan el mismo vector para “banco”.
LLM (contextual)
Ejemplo:
“banco financiero” produce un vector cercano a “economía”, “dinero”. “banco del parque” produce un vector cercano a “asiento”, “madera”.
Nota
Cuando un modelo trata “no es bueno” como bag-of-words, pierde la negación. La atención permite que “no” pondere lo que viene después
¿Qué necesitamos?
Un mecanismo que, para cada token nuevo, decida cuáles tokens previos importan y los pondere en consecuencia
Esa es la innovación de los transformers
Atención = ponderación dinámica del contexto
“La gata se sentó en la alfombra porque estaba caliente.”
Para saber qué estaba caliente, el modelo computa atención desde “estaba”:
Nota
Las primeras capas tienden a aprender gramática. Las últimas, semántica y razonamiento. Es lo que sugieren los estudios de interpretabilidad
Fuente: Jay Alammar
Nota
Recurso interactivo: Transformer Explainer permite ver cada paso con un modelo pequeño
Un parámetro es como un coeficiente de regresión: un número que el modelo aprende de los datos. Un LLM tiene miles de millones.
| Word2Vec (2013) | GPT-3 (2020) | GPT-4 (2023) | |
|---|---|---|---|
| Parámetros | ~300 millones | 175 mil millones | ~1 billón (estimado) |
| Datos de entrenamiento | Wikipedia (GB) | 570 GB de texto | Petabytes |
| Tokens vistos | Millones | 300 mil millones | ~13 billones |
| Costo estimado | Horas de GPU | ~USD 4 millones | ~USD 100 millones |
| Tiempo de entrenamiento | Días | Semanas | Meses |
Una capacidad emergente que nos interesa
In-context learning: el modelo “aprende” de los ejemplos que le damos en el prompt, sin actualizar sus pesos
Esto solo funciona a escala suficiente. Modelos pequeños no lo logran
Lo veremos a continuación 😉
El experimento
Dar al modelo unos pocos ejemplos en el prompt:
Traduce al inglés:
- gato → cat
- perro → dog
- casa → house
- libro →
Sin entrenamiento, sin actualizar pesos. Solo le pasamos los ejemplos en el contexto. El modelo continúa el patrón:
- libro → book
Por qué importa
Comparación
| Enfoque | Datos necesarios |
|---|---|
| Entrenar un clasificador | ~1000 ejemplos |
| Fine-tuning de LLM | ~100 ejemplos |
| In-context learning | 3 a 10 ejemplos |
\[P(\text{próximo token} \mid \text{contexto previo})\]
\[P(\text{afirmación verdadera})\]
Fuente: Vectara Hallucination Leaderboard (julio de 2026)
El modelo resume un documento que le dan, y se cuenta cuántas veces agrega datos que no están en ese documento. Aun con la fuente a la vista, del 2% al 7% de los resúmenes inventan algo
| Modelo | Empresa | Contexto | Costo (entrada) | Acceso |
|---|---|---|---|---|
| GPT-5.5 | OpenAI | ~1M | ~USD 5/M tokens | API |
| GPT-5 mini | OpenAI | 400K | ~USD 0,25/M tokens | API |
| Claude Opus 4.8 | Anthropic | 1M | ~USD 5/M tokens | API |
| Claude Sonnet 4.6 | Anthropic | 1M | ~USD 3/M tokens | API |
| Gemini 2.5 Pro | 1M | ~USD 1,25/M tokens | API | |
| Grok 4.3 | xAI | 1M | ~USD 1,25/M tokens | API |
Precios y versiones de junio de 2026; el mercado cambia rápido, conviene verificar los valores actuales
ollama pull granite4.1:3b y listo)Principales modelos abiertos
| Modelo | Empresa | Tamaños |
|---|---|---|
| Llama 4 | Meta | Scout, Maverick |
| Qwen 3.5 | Alibaba | 4B a 235B |
| DeepSeek V4 | DeepSeek | 671B MoE (~22B activos) |
| Mistral Large 3 | Mistral AI | 675B MoE (~41B activos) |
| Gemma 4 | chicos a medianos |
Ventajas
Limitaciones
Por qué caben igual
Volveremos a Ollama mañana, en la sesión de aplicaciones
La imagen se parte en parches; cada parche es un token
Fuente: Dosovitskiy et al. (2020)
Nota
Idea clave: texto, imagen y sonido terminan siendo el mismo tipo de números (embeddings). Por eso un solo modelo puede con todo
Arriba la onda; abajo, el mismo sonido como imagen
Fuente: Bäckström et al. (2026)
Siete ideas para llevarse:
ellmer con OpenRouter (gratis) desde Rquallmer: definir un codebook y validar¡Nos vemos en la próxima sesión! 🤓