The New York Times is the latest to go to battle against AI scrapers
The New York Times is the latest to go to battle against AI scrapers
La era del acceso sin restricciones a los datos abiertos de Internet para entrenar modelos de inteligencia artificial generativa está llegando rápidamente a su fin. Grandes editoriales, como The New York Times, están prohibiendo explícitamente que su contenido sea extraído (scraped) para entrenar futuros modelos de IA, lo que está cambiando el paradigma: de un acceso libre y abierto a un acceso controlado, a menudo mediante licencias compensadas. Este cierre de las fuentes de datos señala un punto de inflexión crítico, en el que los recursos fundamentales para el desarrollo de la IA se están volviendo propietarios en lugar de estar universalmente disponibles, obligando a las empresas tecnológicas a buscar nuevas vías legales para obtener información de alta calidad. Este cambio pone de manifiesto un conflicto creciente entre la sed de datos de la industria de la IA y las demandas de los creadores de contenido por el reconocimiento de su propiedad y la obtención de ingresos. Como se ha visto con otras plataformas que restringen el acceso a sus APIs, las organizaciones mediáticas están reclamando el control sobre su propiedad intelectual para garantizar que sean compensadas por el valor que su trabajo aporta a los desarrolladores de IA. El foco del debate se está desplazando desde la adaptación de modelos existentes, que ya contienen datos extraídos, hacia la obtención de derechos para las futuras iteraciones, estableciendo así un mercado en el que los datos se tratan como un activo licenciable en lugar de un bien público. Para la comunidad de datos abiertos, esta tendencia representa una amenaza significativa para el ethos de la información libre y accesible. Si las principales fuentes de texto y medios de alta calidad se ven detrás de muros de pago o acuerdos de licencia exclusivos, la capacidad de desarrollar sistemas de IA transparentes y libres de sesgos se verá disminuida. Este desarrollo subraya la urgente necesidad de marcos legales claros que equilibren la innovación con los derechos de los creadores, ya que la incertidumbre actual podría obstaculizar el espíritu colaborativo esencial para el movimiento de datos abiertos y conducir a un paisaje digital fragmentado.
Fuente: popsci.comPublicado el 2023-08-17
Noticias relacionadas
- Anti-Piracy Group Takes Prominent AI Training Dataset ''Books3' Offline * TorrentFreak
- Tech Thoughts: Media needs a united front against data scraping to train AI
- Column: It's not just Zoom: How websites and apps harvest your data to build AI
- UMG, Sony, and Capitol launch copyright lawsuit against Internet Archive