Sesión 5.2: Ética, sesgo y regulación
Esta semana aprendimos a usarla
ellmer y quallmerRecién, en la sesión 5.1
Ahora: las preguntas difíciles
Saber usar una herramienta y saber cuándo no usarla son dos cosas distintas
Sesgo: qué es y de dónde viene
Medir la equidad
Privacidad
Regulación y cierre
¿Qué pasó?
Fuente: ACLU; NPR (2020)
La palabra aparece en contextos distintos y conviene separarlos antes de seguir:
| Uso | Qué significa | Ejemplo |
|---|---|---|
| Estadístico | Desviación sistemática del valor verdadero | Una muestra que sobrerrepresenta a Montevideo |
| Cognitivo | Atajos mentales de las personas | Confirmar lo que ya creíamos |
| Cultural | Supuestos aprendidos de la sociedad | Asociar profesiones con géneros |
| Histórico | Desigualdades pasadas registradas en datos | Décadas de contrataciones discriminatorias |
| Algorítmico | Resultados sistemáticamente injustos de un sistema | El tema de hoy |
En IA, sesgo suele significar:
Un sistema que produce resultados sistemáticamente injustos para ciertos grupos de personas.
Ejemplo: word embeddings (Bolukbasi et al., 2016)
Fuente: UNESCO
La parte difícil no es detectar diferencias, es decidir qué cuenta como “injusto”.
Una universidad decide admisiones. Hay dos opciones:
Opción A: un comité humano
Opción B: un algoritmo
Para discutir (2 min)
No hay respuesta correcta: la pregunta revela qué tipo de injusticia nos resulta más tolerable.
| Tipo de sesgo | Cuándo ocurre | Ejemplo |
|---|---|---|
| Histórico | Decisiones pasadas codificadas en datos | IA de contratación de Amazon penaliza CVs “de mujeres” |
| Representación | Grupos subrepresentados | 35% de error en mujeres de piel oscura |
| Medición | Proxies para conceptos no medibles | Código postal como proxy de solvencia |
| Agregación | Tratar grupos diversos como uno | Un modelo “global” falla localmente |
| Evaluación | Benchmarks no representativos | Probado en España, usado en Argentina |
| Despliegue | Modelo usado en contexto equivocado | Modelo de 2015 aplicado en 2025 |
Cuando las predicciones del algoritmo influyen en los datos que lo entrenarán después.
Ejemplo: vigilancia predictiva (Lum e Isaac, 2016)
El algoritmo crea evidencia para sus propias predicciones.
Fuente: SpotCrime
Otros bucles:
Brasil: reconocimiento facial policial
Argentina: predecir embarazos adolescentes
Chile: Sistema Alerta Niñez
Colombia: reconocimiento facial en el transporte
Los mismos problemas del norte global se replican en la región, a menudo con menos protecciones y menos prensa.
Un ejemplo concreto: un banco usa un modelo para aprobar créditos. Se presentan 100 personas del Grupo A y 100 del Grupo B. Sabemos (después) quiénes pagaron.
| Métrica | La pregunta, en simple | En el ejemplo |
|---|---|---|
| Paridad demográfica | ¿Aprobamos a los dos grupos por igual? | A: 50 de 100 aprobados. B: 30 de 100. No hay paridad |
| Igualdad de oportunidades | Entre los que sí pagan, ¿aprobamos por igual? | De los buenos pagadores, A: 80% aprobados. B: 60%. Hay buenos pagadores de B que el modelo rechaza más |
| Calibración | Un “70% de probabilidad de pago”, ¿vale lo mismo? | De quienes recibieron un score de 70, ¿pagan ~70 de cada 100 en ambos grupos? |
Las tres suenan razonables. Cada una captura una noción distinta de “justo”, y elegir una es elegir a quién proteger. La próxima diapositiva muestra que no se pueden tener todas.
Tres criterios de equidad (simplificados):
El teorema (Chouldechova, 2017; Kleinberg et al., 2016):
Si las tasas base difieren entre grupos, no se pueden satisfacer los tres criterios a la vez.
En simple: si el Grupo A reincide al 40% y el B al 20%, hay que elegir qué tipo de error igualar.
Fuente: Fairness and Machine Learning Book
No existe una solución matemáticamente “justa”. Ningún algoritmo decide qué errores importan más.
| Definición | Prioriza | Desventaja |
|---|---|---|
| Igual trato | Consistencia | Ignora el contexto |
| Igualdad de resultados | Equidad | Puede requerir trato diferenciado |
| Igual tasa de error | Paridad entre grupos | Puede sacrificar precisión |
| Calibración | Precisión individual | Oculta disparidades |
Aun después de elegir una definición, quedan trade-offs que ningún ajuste técnico elimina:
| Tensión | El dilema |
|---|---|
| Precisión vs equidad | Imponer una restricción de equidad suele bajar la accuracy global. ¿Cuánta precisión vale una mejora en paridad? |
| Individual vs grupal | Tratar igual a individuos similares puede producir disparidades entre grupos, y corregir al grupo puede tratar distinto a individuos similares |
| Transparencia vs manipulación | Publicar los criterios permite auditarlos, y también permite “jugarle” al sistema |
| Corto vs largo plazo | Una corrección hoy cambia los datos de mañana: los bucles de retroalimentación también funcionan a favor |
Cada tensión es una decisión de diseño que alguien toma, la haga explícita o no.
No se puede igualar todo a la vez. El umbral es una elección de valores.
Detectar: tres pasos
Herramientas
| Herramienta | Lenguaje |
|---|---|
| fairmodels | R |
| AI Fairness 360, Fairlearn, Aequitas | Python |
Mitigar: tres momentos
Ninguna técnica es perfecta: la mitigación siempre implica trade-offs.
El laboratorio de hoy hace una auditoría completa con fairmodels sobre datos de crédito.
¿Qué es COMPAS?
El análisis de ProPublica (2016):
La respuesta de Northpointe:
¿Quién tiene razón? Ambos. El debate no es sobre hechos sino sobre valores: ¿qué error importa más?
Fuente: ProPublica (2016)
Tres cosas que antes no pasaban:
El caso clásico de inferencia
La cadena Target (EE.UU.) identificó el embarazo de una adolescente por sus patrones de compra y mandó cupones de bebé a su casa, antes de que su padre lo supiera (New York Times, 2012).
El problema no es solo qué datos entregamos, sino qué se puede inferir de ellos. El consentimiento que firmamos rara vez cubre eso.
Por qué importa para esta clase
“Estaba disponible públicamente” no es lo mismo que “consentí este uso”. Eso aplica también a los datos que usamos en investigación.
El modelo europeo (GDPR, 2018)
Uruguay llegó antes que la región
Donde la IA tensiona la ley
| El derecho | El problema técnico |
|---|---|
| Minimización | Los LLMs quieren todos los datos |
| Olvido | “Desentrenar” un modelo es casi imposible |
| Explicación | Las cajas negras no se explican solas |
Para investigadores, la defensa más práctica ya la vimos en la sesión 5.1: con un modelo local, los datos de los participantes nunca se transfieren a un tercero.
Primera ley integral sobre IA en el mundo. Clasifica los sistemas por nivel de riesgo:
| Nivel | Ejemplos | Requisitos |
|---|---|---|
| Inaceptable | Scoring social masivo, vigilancia biométrica en tiempo real | Prohibido |
| Alto riesgo | Salud, justicia, empleo, crédito, educación | Auditoría y registro |
| Riesgo limitado | Chatbots, deepfakes | Transparencia |
| Riesgo mínimo | Filtros de spam, videojuegos | Sin restricciones |
Multas: hasta 35 millones de euros o 7% de la facturación global
Aplicación: gradual entre 2024 y 2027
Para investigadores: los sistemas de IA para investigación suelen estar exentos, pero si se despliegan, aplica la regulación.
Fuente: European Commission
Estados Unidos: fragmentado
América Latina: en construcción
La autorregulación de la industria no es suficiente: sin poder de aplicación y con conflicto de intereses.
En su propia investigación
En la sociedad
Preguntas para cada proyecto
La ética no es un paso final; es parte del diseño desde el inicio.
Sesgo
Medición
Privacidad
Regulación
Para llevarse
Ahora: el laboratorio 9, con el modelo local y la auditoría de equidad. Después, sus propuestas de investigación
La discriminación pasada se incorpora a los datos, aunque reflejen con precisión el mundo de ese momento.
El caso de Amazon (2018) (Reuters):
Datos precisos ≠ datos justos.
Fuente: Reuters
Cuando ciertos grupos están subrepresentados, el modelo funciona mal para ellos.
Reconocimiento facial (Buolamwini y Gebru, 2018):
Asistentes de voz: entrenados con acentos angloamericanos, fallan más con hablantes no nativos y voces de mujeres.
Si no están en los datos, el modelo no tiene nada que aprender sobre ustedes.
Fuente: Joy Buolamwini
Usar un proxy medible para algo que importa, pero que no funciona igual para todos.
Código postal como proxy crediticio
| Lo que queremos | Proxy usado | Problema |
|---|---|---|
| Inteligencia | Tests estandarizados | Refleja acceso a preparación |
| Necesidad de salud | Gasto pasado | Refleja barreras de acceso |
Se puede quitar la raza de los datos y aun así terminar con un modelo racialmente sesgado (Obermeyer et al., 2019).
Fuente: Harvard Law Review
Agregación: tratar a grupos diversos como homogéneos.
Evaluación y despliegue: probar o usar el modelo en el contexto equivocado.
| Entrenado en… | Usado en… | Problema |
|---|---|---|
| España | Argentina | “boludo”, voseo |
| EE.UU. | Uruguay | Diferencias culturales |
| 2015 | 2025 | Cambios temporales |
| Texto formal | Redes sociales | Registro distinto |
El rendimiento no viaja bien entre contextos.
Paridad demográfica
\[P(\hat{Y} = 1 \mid A = a) = P(\hat{Y} = 1 \mid A = b)\]
Misma tasa de resultados positivos entre grupos. Garantiza representación, pero ignora las tasas base.
Igualdad de oportunidades
\[P(\hat{Y} = 1 \mid Y = 1, A = a) = P(\hat{Y} = 1 \mid Y = 1, A = b)\]
Entre quienes merecen el resultado, mismo TPR. Requiere conocer el resultado real.
Calibración
\[P(Y = 1 \mid \hat{Y} = p, A = a) = p\]
Una predicción de p% significa lo mismo para todos los grupos. Hace las predicciones interpretables, pero no garantiza igualdad de errores.
COMPAS estaba calibrado pero tenía falsos positivos desiguales por raza. Las métricas chocan entre sí.
Los optimistas
“Un algoritmo sesgado se puede reentrenar. Un gerente de contratación sesgado es más difícil de arreglar.”
Los escépticos
“No se arregla un mercado inmobiliario discriminatorio ajustando un modelo de scoring crediticio.”
¿Dónde se ubican ustedes?
Estándares técnicos
Principios de la industria
Críticas
Consenso emergente: se necesita regulación vinculante con supervisión externa.
Están diseñando un algoritmo de aprobación de préstamos
Los datos muestran:
Elijan UNO:
Para discutir (10 min):
Debatan en grupos de 3-4 y presenten su decisión.
Una universidad uruguaya quiere predecir qué estudiantes tienen riesgo de deserción y ofrecerles apoyo temprano.
El modelo usa:
Tiene 85% de precisión.
Para discutir (10 min):
Un modelo puede ser preciso en promedio pero injusto para ciertos grupos.