Inside Big Tech's underground race to buy AI training data

Inside Big Tech's underground race to buy AI training data

El artículo destaca el surgimiento de un mercado lucrativo en el que las empresas tecnológicas licencian contenido histórico generado por usuarios para entrenar modelos de inteligencia artificial generativa. Al alejarse del raspado web no regulado, las principales empresas de IA están recurriendo cada vez más a plataformas como Photobucket, Shutterstock y Reddit para obtener los derechos sobre vastos archivos de imágenes y videos. Este cambio reconoce los riesgos legales y éticos del uso no autorizado de datos, creando nuevas fuentes de ingresos para los servicios de internet tradicionales, al tiempo que garantiza que los desarrolladores de IA tengan acceso a conjuntos de datos de alta calidad y conformes con la normativa. Ha surgido una industria especializada de intermediarios de datos para facilitar estas transacciones, asegurando que el contenido sea "obtenido éticamente" mediante la obtención de consentimiento y la eliminación de identificadores personales. Estos intermediarios permiten a los gigantes tecnológicos mitigar el riesgo de demandas por infracción de derechos de autor y de escrutinio regulatorio, pagando directamente a los creadores. El mercado resultante implica negociaciones complejas sobre precios y volúmenes, lo que refleja el enorme valor que se otorga a las colecciones privadas y curadas, que no están fácilmente disponibles mediante búsquedas en la internet abierta, formalizando así lo que anteriormente era un proceso de extracción de datos gratuito y caótico. Esta tendencia es relevante para los datos abiertos, ya que ilustra una tensión crítica entre la web abierta y los conjuntos de datos restringidos y licenciados. Mientras que los defensores de los datos abiertos abogan por la información gratuita y accesible, el auge de la IA está impulsando un cambio hacia fuentes de datos propietarias, con acceso restringido mediante pago o basadas estrictamente en el consentimiento. Esto podría fragmentar el panorama de los datos públicos, ya que la información valiosa se verá bloqueada tras acuerdos comerciales en lugar de permanecer disponible abiertamente, planteando preguntas significativas sobre la transparencia, la privacidad y la accesibilidad a largo plazo del patrimonio cultural digital para uso público.

Fuente: dunyanews.tv
Publicado el 2024-04-07