Última hora
16:00Irtra invierte Q700 millones en Xetulhá y atribuye su crecimiento a la transparencia y la autonomía15:58Eclipse solar, meteoros y auroras boreales: los eventos astronómicos imperdibles de agosto que iluminarán el cielo15:56Cómo y dónde conseguir las galletas Oreo x BTS en México15:56Rendición de Cuentas: diputado del PN cuestionó la falta de avances en las “grandes obras” que anunció ASSE15:55Los bonos de Petroperú cotizan al alza en el segundo trimestre de 202615:55Primer ministro de Portugal dice que las dos propuestas por TAP "valorizan" la aerolínea16:00Irtra invierte Q700 millones en Xetulhá y atribuye su crecimiento a la transparencia y la autonomía15:58Eclipse solar, meteoros y auroras boreales: los eventos astronómicos imperdibles de agosto que iluminarán el cielo15:56Cómo y dónde conseguir las galletas Oreo x BTS en México15:56Rendición de Cuentas: diputado del PN cuestionó la falta de avances en las “grandes obras” que anunció ASSE15:55Los bonos de Petroperú cotizan al alza en el segundo trimestre de 202615:55Primer ministro de Portugal dice que las dos propuestas por TAP "valorizan" la aerolínea
Volver a portada
Tecnología

Empresas de IA buscan libros humanos para entrenar modelos mientras se abre nueva disputa sobre el conocimiento

Empresas de inteligencia artificial buscan libros antiguos y documentos humanos para entrenar sus modelos, mientras se genera debate sobre derechos de autor, calidad informativa y qué perspectivas y culturas quedan representadas en estos sistemas.

A
Resumen IA — Tres claves
  • Empresas de IA recurren a libros antiguos escaneados como datos de entrenamiento debido al valor de información producida por humanos antes del auge de IA generativa.
  • Investigadora del Tec advierte que datos sintéticos pueden amplificar desequilibrios: IA entrenada con sesgos occidentales representó mujer mexica como blanca y sexualizada.
  • Para América Latina, introducir más documentos en sistemas de IA puede ampliar representación del conocimiento, pero plantea cuestiones sobre quién recopila, bajo qué reglas y con qué propósitos.
Fotografía referencial · Ahora

Las empresas de inteligencia artificial regresan a las bibliotecas y librerías en busca de libros escritos por humanos, ya que mientras internet se llena de contenido generado por máquinas, los textos producidos antes del auge de la IA generativa adquieren nuevo valor para entrenar modelos. Una investigación documentada por 404 Media mostró cómo empresas vinculadas con la industria de la IA recurren a libros antiguos que se escanean para convertirlos en datos de entrenamiento.

Patricia Murrieta, investigadora del Tecnológico de Monterrey especialista en la relación entre tecnología, historia y conocimiento, explica que el valor de los libros para la IA reside en que son una fuente de información producida por humanos. Sin embargo, advierte que cuando datos sintéticos producidos o procesados por herramientas de IA vuelven a alimentar nuevos modelos, pueden contener errores, alucinaciones o información sin control editorial. "Los datos de calidad suelen partir de algo llamado 'ground truth', información verificada y certera", recalca Murrieta, categoría en la que entran los libros, artículos y otros materiales producidos por personas.

PublicidadResponsive

Los modelos generativos funcionan como cajas negras donde, una vez que grandes cantidades de información entran en ellas, resulta complicado identificar qué parte de una respuesta proviene de una fuente específica. Murrieta subraya que los documentos siempre tienen una función relacionada con los intereses de quien escribe y hacia quién se dirige. "En una investigación histórica tradicional, el especialista conoce ese problema; un historiador no solo lee el documento sino que intenta entender quién lo produjo, en qué momento, con qué intención y desde qué perspectiva", explica.

Para América Latina, el hecho de introducir más documentos regionales a los sistemas de IA puede ser una oportunidad para ampliar la representación del conocimiento, pero plantea cuestionamientos sobre quién recopila esos materiales, bajo qué reglas y con qué propósitos. Murrieta ejemplifica con un experimento donde pidió al modelo que representara a una mujer mexica y el resultado fue una mujer blanca, sexualizada y acompañada de elementos estereotípicos asociados desde una mirada occidental con la cultura mexica, demostrando cómo la IA no solo depende de la cantidad de información disponible sino de quién la produce y qué perspectivas se priorizan, según reportó Expansión.

Este artículo fue redactado con asistencia de IA a partir de fuentes públicas y está sujeto a revisión editorial de Ahora.

Fuentes

Recomendados

Ver todo