Inside Big Tech's underground race to buy AI training data - ET Telecom
Inside Big Tech's underground race to buy AI training data - ET Telecom
El artículo revela el surgimiento de un mercado lucrativo y de alto riesgo para la licencia de contenido digital destinado a entrenar modelos de inteligencia artificial generativa. Las principales empresas tecnológicas están pasando de la extracción gratuita de datos de la web a la compra de vastas bibliotecas de imágenes, videos y textos procedentes de archivos privados y corredores de datos. Esta transición está impulsada por la creciente presión legal de los titulares de derechos de autor y por la necesidad de contar con datos de alta calidad y verificables, lo que crea una importante oportunidad financiera para las entidades que poseen activos digitales históricos. Sin embargo, esta "fiebre del oro de los datos" plantea complejos desafíos éticos y de privacidad. Si bien algunas empresas destacan su "obtención ética" de datos mediante la obtención de consentimiento y la eliminación de identificadores personales, otras enfrentan críticas por explotar el contenido generado por los usuarios sin permiso explícito. La aplicación retroactiva de los términos de servicio para permitir el entrenamiento de IA suscita preocupaciones de que los recuerdos privados o las obras creativas de las personas puedan ser incorporados en los sistemas de IA sin su conocimiento, lo que podría dar lugar a resultados no deseados que reproduzcan material sensible o protegido por derechos de autor. Este desarrollo es crucial para los debates sobre datos abiertos, ya que cuestiona la suposición de que los datos de acceso público son gratuitos para su uso comercial en IA. El mercado ilustra una tensión entre el flujo abierto de la información y el control propietario, sugiriendo que el futuro del entrenamiento de IA podría depender de conjuntos de datos curados y licenciados, en lugar de la extracción indiscriminada de datos abiertos. Este cambio afecta a la gobernanza de los datos, los derechos de privacidad y la definición de propiedad, destacando la necesidad de marcos regulatorios claros para proteger a las personas en la era de la extracción algorítmica de datos.
Fuente: telecom.economictimes.indiatimes.comPublicado el 2024-04-06