Laboratorios y Tareas

Ejercicios prácticos

Cada día incluye un laboratorio donde aplicamos los conceptos discutidos en clase a datos reales. Los laboratorios se realizan en R usando RStudio.

Lab 1: Primer flujo de trabajo con tidymodels

Día 1. Configuración del entorno, carga de datos, división train/test, ajuste de un modelo simple y evaluación de métricas básicas.

Lab 2: Exploración avanzada y comparación de modelos

Día 1. Exploración de datos de satisfacción democrática en América Latina. Feature engineering, comparación de regresión logística, árboles de decisión y KNN con tidymodels.

Lab 3: Clasificación avanzada con Latinobarómetro

Día 2. Clasificación avanzada con datos simulados de Latinobarómetro. Random Forest con tuning de hiperparámetros, XGBoost, interpretación con VIP y Partial Dependence Plots.

Lab 4: Regresión y regularización

Día 2. Regresión lineal, LASSO, Ridge y Elastic Net con glmnet. Selección de variables, comparación de modelos de regresión y predicción con datos de Latinobarómetro.

Lab 5: Clustering y PCA

Día 3, sesión 1. Segmentación de países latinoamericanos por indicadores socioeconómicos usando K-means, clustering jerárquico y PCA. Visualización con biplot.

Lab 6: Análisis de texto

Día 3, sesión 2. Tokenización, TF-IDF y análisis de sentimiento con diccionarios sobre discursos políticos latinoamericanos. Uso de tidytext para identificar palabras distintivas y medir el tono de los textos.

Lab 7: Primeros pasos con ellmer

Día 4. Configuración de ellmer con OpenRouter (y Ollama local como alternativa). System prompts, clasificación zero-shot y few-shot de textos políticos, y comparación directa con el LDA del Día 3.

Lab 8: Codificación y confiabilidad con LLMs

Día 4. Codificación de texto con quallmer: diseñar un codebook, medir retórica liberal-iliberal en una escala de intervalo, validar contra códigos humanos (qlm_validate) y medir confiabilidad con test-retest (qlm_replicate y qlm_compare). Auditoría de sesgo de género usando un LLM como codificador y generación de datos sintéticos de encuesta.

Lab 9: Modelos locales y auditoría de equidad

Día 5. Codificación de entrevistas sensibles (simuladas) con quallmer y un modelo local vía Ollama: codebook nominal, validación contra un gold standard humano y reglas de decisión para casos límite. Auditoría de equidad de un modelo de crédito con fairmodels: regla del 80%, métricas por grupo y mitigación con umbrales diferenciados.

Lab 10: Mini-propuestas de investigación y cierre

Día 5. Taller de cierre: cada estudiante (individual o en parejas) diseña una mini-propuesta de investigación que integre los métodos del curso (pregunta, datos, técnica, evaluación y consideraciones éticas), seguida de una discusión final. No tiene tarea ni datos asociados.

Requisitos de software

Antes del primer día, asegurarse de tener instalado:

install.packages(c(
  # Núcleo
  "tidyverse", "tidymodels",
  # Día 2: clasificación, regresión y regularización
  "ranger", "xgboost", "glmnet", "kknn",
  "rpart", "rpart.plot", "broom", "vip", "pdp", "patchwork",
  # Día 3: clustering, PCA y análisis de texto
  "cluster", "factoextra", "dendextend", "corrplot",
  "tidytext", "topicmodels", "tm", "ggwordcloud",
  # Día 4: modelos de lenguaje (LLMs)
  "ellmer", "jsonlite", "pak", "usethis",
  # Día 5: auditoría de sesgo algorítmico
  "fairmodels", "DALEX"
))

El paquete quallmer (Día 4) no está en CRAN, así que se instala desde GitHub con pak (que acaban de instalar en el bloque anterior):

pak::pak("quallmer/quallmer")

Para los Días 4 y 5 también necesitan Ollama instalado y el modelo local descargado. Desde una terminal, ejecutar:

ollama pull granite4.1:3b

Consulten la sección Software necesario de la pestaña Programa para las instrucciones de instalación paso a paso.

Se enviarán instrucciones detalladas de instalación por correo electrónico antes del inicio del curso.

Volver arriba