Sesión 5.4: Mini-propuestas de investigación y cierre
| Día | Técnicas | Paquetes de R |
|---|---|---|
| 1 | Flujo de ML, train/test, métricas (accuracy, precision, recall) | tidymodels |
| 2 | Regresión logística, árboles de decisión, Random Forest, LASSO/Ridge/Elastic Net | tidymodels, ranger, glmnet |
| 3 | K-means, PCA, tokenización, TF-IDF, análisis de sentimiento, LDA | tidytext, topicmodels |
| 4 | LLMs, embeddings, prompt engineering, RAG, anotación automática, APIs | ellmer, quallmer |
| 5 | Modelos locales (Ollama, cuantización), sesgo algorítmico, equidad y auditoría, regulación | ellmer, quallmer, fairmodels, DALEX |
Cada una de estas técnicas puede aplicarse a una pregunta de investigación en ciencias sociales.
Ejemplos de preguntas que podrían abordar:
Clasificación / predicción
Texto / LLMs
ellmer + comparaciónPregunta: ¿los LLMs clasifican el sentimiento de tweets políticos en español con la misma precisión que anotadores humanos?
Datos: 500 tweets sobre elecciones en Uruguay (2024), ya anotados por 3 investigadores
Técnica: Clasificación con ellmer (GPT-4o-mini y Claude Haiku), comparando con etiquetas humanas
Evaluación: accuracy, precision, recall; comparar con acuerdo inter-anotador (Cohen’s kappa)
Consideraciones éticas:
Por qué importa: si los LLMs funcionan bien, democratizan el acceso al análisis de texto a gran escala para investigadores con pocos recursos
Día 1: Fundamentos
Día 2: Aprendizaje supervisado
Día 3: Texto y no supervisado
Día 4: LLMs y aplicaciones
Día 5: Modelos locales, ética y cierre
Recursos gratuitos
Herramientas para explorar
Comunidades
Todos los materiales seguirán disponibles:
Las diapositivas, datasets, scripts de R y lecturas recomendadas están en el repositorio.
Si tienen preguntas en el futuro, no duden en escribirme. Siempre estoy disponible para ayudar 😉