Study: Transparency is often lacking in datasets used to train large language models

El estudio revela que la mayoría de los conjuntos de datos utilizados para entrenar modelos de lenguaje grandes adolecen de información de licencia faltante o incorrecta, lo que genera importantes riesgos legales y éticos. Cuando se pierden el origen de los datos y las restricciones de uso durante el proceso de agregación, los profesionales pueden utilizar, sin saberlo, datos inadecuados o sesgados, lo que conduce a predicciones injustas por parte de los modelos y a posibles incumplimientos normativos. Esta falta de transparencia socava la fiabilidad de los sistemas de inteligencia artificial, especialmente en áreas sensibles como la evaluación de préstamos, donde comprender el origen de los datos es crucial para evaluar las limitaciones y los riesgos del modelo. Para abordar este problema, los investigadores crearon el Explorador de Procedencia de Datos (Data Provenance Explorer), una herramienta que genera automáticamente resúmenes claros sobre los creadores, las fuentes y las licencias de los conjuntos de datos. Esta innovación apoya directamente las iniciativas de datos abiertos al hacer que los ecosistemas de datos opacos sean legibles y navegables para la comunidad en general. Al aclarar quién creó los datos y cómo pueden utilizarse legalmente, la herramienta empodera a los desarrolladores para tomar decisiones informadas, garantizando que los conjuntos de datos abiertos se utilicen de manera responsable y eficaz, sin necesidad de realizar auditorías manuales de miles de fuentes. Además, la auditoría puso de manifiesto un sesgo geográfico en la creación de conjuntos de datos, con la mayoría de los contribuyentes ubicados en el Norte Global, lo que limita la eficacia de los modelos en otras regiones. Este hallazgo subraya la necesidad de prácticas de datos más diversas y transparentes en la comunidad de datos abiertos. Al exponer estas disparidades y proporcionar herramientas para rastrear la procedencia de los datos, la investigación fomenta el desarrollo de sistemas de inteligencia artificial más equitativos. En última instancia, mejorar la procedencia de los datos es esencial para construir modelos de inteligencia artificial confiables, jurídicamente sólidos y culturalmente representativos.

Source: news.mit.edu
Published on 2024-08-31