A.I. Companies Are Running Out of Training Data: Study

La rápida expansión de los modelos de inteligencia artificial se está enfrentando a una grave escasez de datos de entrenamiento de alta calidad, impulsada por un aumento en las restricciones impuestas por las fuentes web. Muchos sitios web ahora bloquean a los rastreadores automatizados, reduciendo significativamente el conjunto de contenido público accesible tanto para desarrolladores comerciales como académicos. Esta "crisis en el consentimiento de datos" sugiere que el libre flujo de información que sustenta los avances actuales en IA se está volviendo cada vez más insostenible. Esta escasez está obligando a las principales empresas tecnológicas a cambiar de la recolección abierta a costosos acuerdos propietarios y métodos novedosos de obtención de datos. Para asegurar los conjuntos de datos necesarios, las empresas están estableciendo asociaciones multimillonarias con editores de medios, adquiriendo bibliotecas completas o explorando la generación de datos sintéticos como una alternativa futura. Estos cambios en el mercado indican una transición en la que el acceso a los datos se está convirtiendo en una mercancía controlada en lugar de un recurso abierto, lo que podría alterar el panorama competitivo favoreciendo a los actores establecidos con mayores recursos frente a los desarrolladores más pequeños. Para la comunidad de datos abiertos, esta tendencia destaca una tensión fundamental entre la acumulación de datos propietarios y la democratización de la información. El movimiento hacia ecosistemas cerrados y el acceso a datos de pago amenaza con socavar los principios abiertos que históricamente han impulsado la rápida innovación. Esto subraya la necesidad urgente de abogar por prácticas sostenibles y éticas en el manejo de datos que equilibren los derechos de propiedad intelectual con el beneficio social más amplio de contar con información accesible y de alta calidad para la investigación y el desarrollo.

Source: observer.com
Published on 2024-07-20