Lab 2: Exploración avanzada y comparación de modelos
Día 1. Exploración de datos de satisfacción democrática en América Latina. Feature engineering, comparación de regresión logística, árboles de decisión y KNN con tidymodels.
Día 2. Clasificación avanzada con datos simulados de Latinobarómetro. Random Forest con tuning de hiperparámetros, XGBoost, interpretación con VIP y Partial Dependence Plots.
Día 2. Regresión lineal, LASSO, Ridge y Elastic Net con glmnet. Selección de variables, comparación de modelos de regresión y predicción con datos de Latinobarómetro.
Día 3, sesión 1. Segmentación de países latinoamericanos por indicadores socioeconómicos usando K-means, clustering jerárquico y PCA. Visualización con biplot.
Día 3, sesión 2. Tokenización, TF-IDF y análisis de sentimiento con diccionarios sobre discursos políticos latinoamericanos. Uso de tidytext para identificar palabras distintivas y medir el tono de los textos.
Día 4. Configuración de ellmer con OpenRouter (y Ollama local como alternativa). System prompts, clasificación zero-shot y few-shot de textos políticos, y comparación directa con el LDA del Día 3.
Día 4. Codificación de texto con quallmer: diseñar un codebook, medir retórica liberal-iliberal en una escala de intervalo, validar contra códigos humanos (qlm_validate) y medir confiabilidad con test-retest (qlm_replicate y qlm_compare). Auditoría de sesgo de género usando un LLM como codificador y generación de datos sintéticos de encuesta.
Día 5. Codificación de entrevistas sensibles (simuladas) con quallmer y un modelo local vía Ollama: codebook nominal, validación contra un gold standard humano y reglas de decisión para casos límite. Auditoría de equidad de un modelo de crédito con fairmodels: regla del 80%, métricas por grupo y mitigación con umbrales diferenciados.
Día 5. Taller de cierre: cada estudiante (individual o en parejas) diseña una mini-propuesta de investigación que integre los métodos del curso (pregunta, datos, técnica, evaluación y consideraciones éticas), seguida de una discusión final. No tiene tarea ni datos asociados.