Inside Big Tech's underground race to buy AI training data
Inside Big Tech's underground race to buy AI training data
El artículo destaca un mercado en pleno auge en el que las empresas tecnológicas están licitando activamente vastos archivos de contenido digital, como los que poseen plataformas consolidadas como Photobucket, para entrenar modelos de inteligencia artificial generativa. Este cambio marca un alejamiento del raspado web sin restricciones hacia la adquisición negociada de datos, impulsada por presiones legales y la necesidad de conjuntos de datos de entrenamiento confiables y de alta calidad. Las negociaciones revelan un importante valor económico asociado al contenido generado por usuarios en el pasado, con precios que varían ampliamente según el tipo y la exclusividad de los medios. Esta carrera por la apropiación de datos subraya la creciente competencia entre las principales empresas tecnológicas para asegurar fuentes de información éticas y legalmente seguras. Mientras algunas empresas priorizan los datos "obtenidos éticamente", con consentimiento claro y protecciones de privacidad, otras están explorando archivos más antiguos que plantean complejas cuestiones sobre los derechos de los usuarios. La aparición de intermediarios especializados en datos ilustra la industrialización de la adquisición de datos, creando una cadena de suministro estructurada que intenta equilibrar las elevadas demandas computacionales del entrenamiento de la IA con la creciente supervisión regulatoria y la preocupación pública por las violaciones de la privacidad. Este desarrollo es altamente relevante para los datos abiertos, ya que desafía la noción predominante de que la información de acceso público es gratuita para su uso comercial sin restricciones. A medida que los desarrolladores de IA recurren cada vez más a conjuntos de datos licenciados, a menudo privados, los límites entre el acceso abierto y la propiedad propietaria se difuminan. Esto plantea preguntas críticas sobre la propiedad del contenido generado por los usuarios, la legalidad de la reutilización de datos históricos sin consentimiento explícito y la posible erosión de los principios de acceso abierto en favor de ecosistemas de datos cerrados y monetizados.
Fuente: asiaone.comPublicado el 2024-04-08
Noticias relacionadas
- Billie Eilish, Katy Perry y otros 200 artistas publican carta abierta contra la IA | RPP Noticias
- RTE corporate credit card spending appears to be 'in line with guidelines'
- Rates of corporate insolvencies reach levels not seen in six years – Deloitte analysis
- The deadly guns fired on city streets - including little-known firearms