Lecturas

Sobre las lecturas

Este curso es autocontenido: todo lo necesario para seguir las clases y completar los laboratorios se cubre en las sesiones presenciales. Las lecturas que se listan a continuación son opcionales, pensadas para quienes quieran profundizar en algún tema o explorar aplicaciones adicionales. No es necesario leerlas antes de las sesiones.

Lecturas por día

Día 1: Fundamentos de IA y Machine Learning

Russell, S. & Norvig, P. (2021). Artificial Intelligence: A Modern Approach. Capítulo 1.

Introducción clásica a la IA: definiciones, historia y enfoques fundamentales.

James, G., Witten, D., Hastie, T. & Tibshirani, R. (2021). An Introduction to Statistical Learning with Applications in R. Capítulos 1-2.

Fundamentos de aprendizaje estadístico. Disponible gratuitamente en statlearning.com.

Kuhn, M. & Silge, J. (2022). Tidy Modeling with R. O’Reilly. Capítulos 1-3.

Guía práctica para modelado con tidymodels, el ecosistema que usamos en el curso. Disponible gratuitamente en tmwr.org.

Wickham, H., Çetinkaya-Rundel, M. & Grolemund, G. (2023). R for Data Science (2da edición). O’Reilly. Capítulos 1-4.

Referencia para tidyverse. Útil para quienes quieran repasar manipulación de datos y visualización en R. Disponible en r4ds.hadley.nz.

Día 2: Aprendizaje supervisado

James, G., Witten, D., Hastie, T. & Tibshirani, R. (2021). An Introduction to Statistical Learning. Capítulos 4-6 y 8.

Regresión logística (cap. 4), regularización (cap. 6) y árboles de decisión y bosques aleatorios (cap. 8). Disponible en statlearning.com.

Breiman, L. (2001). Statistical modeling: The two cultures. Statistical Science, 16(3), 199-231.

Ensayo clásico que contrasta la cultura de los modelos estadísticos tradicionales con la cultura de la predicción algorítmica. Contexto ideal para los métodos de este día.

Mullainathan, S. & Spiess, J. (2017). Machine learning: An applied econometric approach. Journal of Economic Perspectives, 31(2), 87-106.

Discusión sobre predicción vs. explicación, relevante para científicos sociales que vienen de la tradición inferencial.

Athey, S. & Imbens, G. W. (2019). Machine learning methods that economists should know about. Annual Review of Economics, 11, 685-725.

Revisión de métodos de ML desde una perspectiva econométrica. Cubre árboles, LASSO y bosques causales.

Muchlinski, D. et al. (2016). Comparing random forest with logistic regression for predicting class-membership. Political Analysis, 24(2), 168-185.

Aplicación de Random Forest a la predicción de conflictos civiles. Ejemplo clásico de ML en ciencia política.

Día 3: Texto y aprendizaje no supervisado

Grimmer, J. & Stewart, B. (2013). Text as data: The promise and pitfalls of automatic content analysis methods for political texts. Political Analysis, 21(3), 267-297.

Artículo fundacional sobre el uso de métodos computacionales para analizar textos políticos.

Silge, J. & Robinson, D. (2017). Text Mining with R: A Tidy Approach. O’Reilly.

Manual práctico de análisis de texto en R. Disponible gratuitamente en tidytextmining.com.

Roberts, M. E., Stewart, B. M. & Tingley, D. (2019). stm: An R package for structural topic models. Journal of Statistical Software, 91(2), 1-40.

Descripción del paquete stm para topic models con covariables, una extensión del LDA que veremos en clase.

James, G., Witten, D., Hastie, T. & Tibshirani, R. (2021). An Introduction to Statistical Learning. Capítulos 10 y 12.

Clustering (cap. 10) y PCA (cap. 12). Disponible en statlearning.com.

Día 4: LLMs y aplicaciones

Gilardi, F., Alizadeh, M. & Kubli, M. (2023). ChatGPT outperforms crowd workers for text-annotation tasks. PNAS, 120(30).

Evidencia empírica de que los LLMs pueden superar a anotadores humanos en tareas de clasificación de texto.

Bail, C. A. (2024). Can generative AI improve social science? PNAS, 121(21).

Revisión crítica del potencial y las limitaciones de la IA generativa para la investigación en ciencias sociales.

Törnberg, P. (2024). Best practices for text annotation with large language models. Sociological Methods & Research.

Guía práctica para usar LLMs en tareas de anotación, con recomendaciones metodológicas.

Argyle, L. P. et al. (2023). Out of one, many: Using language models to simulate human samples. Political Analysis, 31(3), 337-351.

Uso de LLMs para generar datos sintéticos que simulan respuestas de encuestas, con aplicaciones a opinión pública.

Benoit, K. et al. (2026). Using large language models to analyze political texts through natural language understanding. American Journal of Political Science.

Trabajo reciente sobre cómo usar LLMs para medir y escalar el contenido de textos políticos, con una evaluación de su validez frente a métodos establecidos. Conecta directamente los Días 3 y 4.

Vaswani, A. et al. (2017). Attention is all you need. Advances in Neural Information Processing Systems, 30.

El artículo original que propone la arquitectura Transformer. Lectura técnica, pero la sección 3 (atención) es accesible.

Día 5: Ética y sesgo algorítmico

O’Neil, C. (2016). Weapons of Math Destruction. Crown.

Libro accesible sobre cómo los algoritmos pueden perpetuar y amplificar desigualdades sociales.

Barocas, S., Hardt, M. & Narayanan, A. (2023). Fairness and Machine Learning. MIT Press.

Referencia sobre equidad algorítmica. Disponible gratuitamente en fairmlbook.org.

Eubanks, V. (2018). Automating Inequality: How High-Tech Tools Profile, Police, and Punish the Poor. St. Martin’s Press.

Casos concretos de cómo los sistemas automatizados afectan a comunidades vulnerables en Estados Unidos. Lectura accesible y muy relevante para científicos sociales.

Raji, I. D. et al. (2020). Closing the AI accountability gap: Defining an end-to-end framework for internal algorithmic auditing. ACM Conference on Fairness, Accountability, and Transparency.

Marco práctico para auditar algoritmos dentro de organizaciones.

Bibliografía complementaria

Estas lecturas no son obligatorias, pero ofrecen perspectivas valiosas para profundizar en temas específicos:

  • Halevy, A., Norvig, P. & Pereira, F. (2009). The unreasonable effectiveness of data. IEEE Intelligent Systems, 24(2), 8-12.
  • Athey, S. (2017). Beyond prediction: Using big data for policy problems. Science, 355(6324), 483-485.
  • Crawford, K. (2021). Atlas of AI. Yale University Press.
  • Gentzkow, M., Kelly, B. & Taddy, M. (2019). Text as data. Journal of Economic Literature, 57(3), 535-574.
  • Grimmer, J., Roberts, M. E. & Stewart, B. M. (2022). Text as Data: A New Framework. Princeton University Press.
  • Lazer, D. et al. (2020). Computational social science: Obstacles and opportunities. Science, 369(6507), 1060-1062.
  • Molina, M. & Garip, F. (2019). Machine learning for sociology. Annual Review of Sociology, 45, 27-45.
  • Salganik, M. J. (2018). Bit by Bit: Social Research in the Digital Age. Princeton University Press.
  • Ziems, C. et al. (2024). Can large language models transform computational social science? Computational Linguistics, 50(1), 237-291.
  • Benoit, K. et al. (2016). Crowd-sourced text analysis: Reproducible and agile production of political data. American Political Science Review, 110(2), 278-295.
  • Blei, D. M., Ng, A. Y. & Jordan, M. I. (2003). Latent Dirichlet Allocation. Journal of Machine Learning Research, 3, 993-1022.
  • Hastie, T., Tibshirani, R. & Friedman, J. (2009). The Elements of Statistical Learning (2da edición). Springer.
  • Knox, D. & Lucas, C. (2021). A dynamic model of speech for the social sciences. American Political Science Review, 115(2), 649-666.
  • Russell, S. (2019). Human Compatible: Artificial Intelligence and the Problem of Control. Viking.
  • Christian, B. (2020). The Alignment Problem: Machine Learning and Human Values. W. W. Norton & Company.
  • Ananthaswamy, A. (2024). Why Machines Learn: The Elegant Math Behind Modern AI. Dutton.
Volver arriba