Modelos de IA reproducen estereotipos raciales y de género en la medicina
Investigadores de la Universidad de Flinders evaluaron dos modelos de lenguaje a gran escala de razonamiento de próxima generación, o3-mini y DeepSeek-R1, y encontraron que estos reproducen frecuentemente estereotipos raciales y de género. Los hallazgos indican que los avances en el razonamiento de la IA no mejoran inherentemente la imparcialidad de la representación en el contenido médico que generan.
- o3-mini mostró 78% de error en representación de raza y 56% en género; DeepSeek-R1 alcanzó 89% en raza y 67% en género, tasas comparables o superiores a GPT-4
- Ambos modelos sobrerrepresentaron poblaciones negras en afecciones estereotípicamente asociadas como sarcoidosis, lupus y preeclampsia, con mediana de error del 44% y 31% respectivamente
- DeepSeek-R1 invocó explícitamente asociaciones entre enfermedades y datos demográficos al seleccionar características de pacientes, sin referencia a datos epidemiológicos cuantitativos
Los investigadores pidieron a los modelos que describieran pacientes ficticios con afecciones médicas comunes y descubrieron que reproducían con frecuencia estereotipos raciales y de género. El hallazgo indica que los avances en razonamiento de la IA no mejoran automáticamente la equidad en la representación. Los resultados se publicaron en la revista Journal of Medical Internet Research.
Para esta investigación, los modelos generaron 36.000 viñetas clínicas únicas. Los investigadores encontraron que o3-mini alcanzó representación errónea en 78% de afecciones para raza y 56% para género, mientras que DeepSeek-R1 llegó a 89% en raza y 67% en género. Estas tasas son comparables o superiores a las de GPT-4, que había alcanzado 67% en ambas categorías.
Ambos modelos, al igual que GPT-4, sobrerrepresentaron poblaciones negras en afecciones estereotípicamente asociadas, como sarcoidosis, lupus eritematoso sistémico, preeclampsia e hipertensión esencial, con una mediana de representación errónea del 44% y 31% respectivamente, superior al 15% en GPT-4. El profesor Michael Sorich, autor principal de la investigación, señaló que este patrón persistente puede reflejar sesgo subyacente, aunque los nuevos modelos también pueden tender a generar casos prototípicos en lugar de muestras representativas debido a patrones en sus datos de entrenamiento, según reportó La Nación.
Este artículo fue redactado con asistencia de IA a partir de fuentes públicas y está sujeto a revisión editorial de Ahora.