IA para Científicos Sociales

Sesión 5.4: Mini-propuestas de investigación y cierre

Danilo Freire

Departament of Data and Decision Sciences
Emory University

Mini-propuestas de investigación

Agenda de la sesión

  • Repaso de técnicas del curso
  • Cómo integrar la IA en investigación
  • Estructura de la mini-propuesta
  • Tiempo para preparar
  • Preguntas y comentarios
  • Discusión
  • Cierre del curso

Repaso: las herramientas del curso

Lo que aprendimos esta semana

Día Técnicas Paquetes de R
1 Flujo de ML, train/test, métricas (accuracy, precision, recall) tidymodels
2 Regresión logística, árboles de decisión, Random Forest, LASSO/Ridge/Elastic Net tidymodels, ranger, glmnet
3 K-means, PCA, tokenización, TF-IDF, análisis de sentimiento, LDA tidytext, topicmodels
4 LLMs, embeddings, prompt engineering, RAG, anotación automática, APIs ellmer, quallmer
5 Modelos locales (Ollama, cuantización), sesgo algorítmico, equidad y auditoría, regulación ellmer, quallmer, fairmodels, DALEX

Cada una de estas técnicas puede aplicarse a una pregunta de investigación en ciencias sociales.

Preguntas de investigación + técnicas de IA

Ejemplos de preguntas que podrían abordar:

Clasificación / predicción

  • ¿Qué factores predicen la satisfacción con la democracia en América Latina?
    • → Reg. logística + Random Forest con datos de Latinobarómetro
  • ¿Se puede predecir el resultado electoral de un municipio a partir de indicadores socioeconómicos?
    • → LASSO + validación cruzada
  • ¿Qué características de un tweet predicen si será compartido masivamente?
    • → Clasificación binaria + ingeniería de variables

Texto / LLMs

  • ¿Cómo ha cambiado el discurso sobre inmigración en la prensa uruguaya en los últimos 10 años?
    • → TF-IDF + LDA + sentimiento
  • ¿Pueden los LLMs anotar el tono de respuestas abiertas de encuestas con precisión comparable a humanos?
    • → Anotación con ellmer + comparación
  • ¿Existen sesgos de género en las recomendaciones de ChatGPT sobre carreras profesionales?
    • → Auditoría de sesgo con prompts controlados

Estructura de la mini-propuesta

¿Qué debe incluir su propuesta?

  1. Pregunta de investigación
    • ¿Qué quieren saber? ¿Por qué importa?
    • Debe ser específica y acotada
  2. Datos
    • ¿Qué datos usarían? ¿De dónde vienen?
    • ¿Están disponibles o habría que recogerlos?
  3. Técnica de IA/ML
    • ¿Qué método del curso aplicarían?
    • ¿Por qué ese método y no otro?
  4. Evaluación
    • ¿Cómo sabrían si su modelo funciona bien?
    • ¿Qué métricas usarían?
  5. Consideraciones éticas
    • ¿Qué sesgos podrían surgir?
    • ¿Cómo los mitigarían?

Ejemplo de mini-propuesta

Pregunta: ¿los LLMs clasifican el sentimiento de tweets políticos en español con la misma precisión que anotadores humanos?

Datos: 500 tweets sobre elecciones en Uruguay (2024), ya anotados por 3 investigadores

Técnica: Clasificación con ellmer (GPT-4o-mini y Claude Haiku), comparando con etiquetas humanas

Evaluación: accuracy, precision, recall; comparar con acuerdo inter-anotador (Cohen’s kappa)

Consideraciones éticas:

  • Los tweets son públicos pero las personas no consintieron ser analizadas
  • Los LLMs pueden tener sesgos con el español rioplatense
  • El sentimiento político es subjetivo; ¿quién tiene la “respuesta correcta”?
  • Costo de la API vs. costo de anotadores humanos

Por qué importa: si los LLMs funcionan bien, democratizan el acceso al análisis de texto a gran escala para investigadores con pocos recursos

Tiempo de preparación

Instrucciones

  • Tienen hasta el final de la sesión para preparar su mini-propuesta
  • Pueden trabajar individualmente o en parejas
  • Pueden usar cualquier recurso: notas del curso, internet, ChatGPT/Claude
  • Si no tienen una idea propia, elijan una de las preguntas de ejemplo y adáptenla a un contexto que les interese
  • Estoy disponible para preguntas y orientación 😊

Cierre del curso

Lo que cubrimos en 5 días

Día 1: Fundamentos

  • ¿Qué es la IA? Historia, tipos de aprendizaje
  • Flujo de trabajo de ML, métricas
  • Primer modelo con tidymodels

Día 2: Aprendizaje supervisado

  • Regresión logística, árboles, Random Forest
  • Predicción vs. explicación
  • Regularización (LASSO, Ridge, Elastic Net)

Día 3: Texto y no supervisado

  • K-means, PCA
  • Tokenización, TF-IDF, sentimiento, LDA

Día 4: LLMs y aplicaciones

  • Transformers, embeddings, atención
  • Prompt engineering (PTCF, CoT, few-shot)
  • Alucinaciones, RAG
  • APIs desde R con ellmer

Día 5: Modelos locales, ética y cierre

  • Modelos locales con Ollama (cuantización, Modelfile)
  • Sesgo algorítmico y teorema de imposibilidad
  • Auditoría de equidad con fairmodels y DALEX
  • Regulación (EU AI Act, Uruguay, región)
  • Mini-propuestas de investigación

Consejos para seguir aprendiendo

Recursos gratuitos

Herramientas para explorar

Comunidades

Materiales del curso

Todos los materiales seguirán disponibles:

Las diapositivas, datasets, scripts de R y lecturas recomendadas están en el repositorio.

Si tienen preguntas en el futuro, no duden en escribirme. Siempre estoy disponible para ayudar 😉

Agradecimientos

  • Gracias a la Universidad Católica del Uruguay y a la Escuela en Métodos por la invitación
  • Más importante, gracias a todos ustedes por su participación y sus preguntas 😉
  • Si algo de esta semana les resultó útil, el siguiente paso concreto es aplicarlo: elijan un dataset que les interese y prueben una técnica del curso
  • Siempre pueden escribirme con preguntas: danilofreire@gmail.com

Muchas gracias 🥳