Using bigger AI training data sets may produce more racist results
Contrario a la creencia generalizada de que aumentar la escala de los datos mejora la equidad, investigaciones recientes indican que conjuntos de entrenamiento más grandes pueden, de hecho, exacerbar los sesgos raciales en la inteligencia artificial. Al comparar conjuntos de datos de tamaños muy diferentes, los investigadores descubrieron que los modelos entrenados con datos más extensos tenían una probabilidad significativamente mayor de asociar a personas negras con categorías criminales. Esto desafía la suposición de la industria de que la cantidad conduce inherentemente a la diversidad, revelando que simplemente añadir más datos extraídos de internet a menudo amplifica los prejuicios existentes en lugar de mitigarlos. El estudio destaca que los conjuntos de datos más grandes frecuentemente contienen proporciones más altas de contenido odioso o agresivo, lo que sugiere que las prácticas actuales de escalado son contraproducentes para el desarrollo ético de la IA. Aunque algunas organizaciones argumentan que los hallazgos están exagerados, la implicación central permanece: la expansión descontrolada de datos sin un riguroso control de calidad conduce a peores resultados. Esto expone una brecha crítica en el campo, ya que muchas empresas tecnológicas no realizan verificaciones básicas para eliminar muestras sesgadas, tratando la escala como una solución suficiente para problemas sociales complejos. Este artículo es vital para los defensores de los datos abiertos porque subraya la urgente necesidad de transparencia y responsabilidad en los recursos de entrenamiento de IA. Critica a las grandes corporaciones por utilizar conjuntos de datos cerrados e inverificables que pueden estar aún más sesgados que las alternativas de código abierto, mientras simultáneamente insta a los proveedores de datos abiertos a mejorar sus estándares de calidad. En última instancia, sostiene que la comunidad de datos abiertos debe priorizar la auditoría rigurosa y el escrutinio público sobre el mero volumen, para garantizar que los sistemas de IA sean equitativos y confiables.
Source: newscientist.comPublished on 2023-12-05
Related news
- ChatGPT can leak training data, violate privacy, says Google's DeepMind
- 'Anonymized Data' Is A Gibberish Term, And Rampant Location Data Sales Is Still A Problem
- ChatGPT will no longer comply if you ask it to repeat a word 'forever'— after a recent prompt revealed training data and personal info
- Pentagon Offered 'FOIA Terrorist' Jason Leopold A Stack Of Documents To Just Shut Up And Go Away Forever