The Guardian, New York Times, CNN figure in growing list of sites blocking OpenAI crawler

The Guardian, New York Times, CNN figure in growing list of sites blocking OpenAI crawler

Los principales editores están bloqueando cada vez más a los rastreadores de inteligencia artificial (IA) para proteger su propiedad intelectual, argumentando que el raspado no autorizado de datos viola los términos de servicio. Esta acción colectiva pone de manifiesto una creciente tensión entre las entidades mediáticas que buscan establecer acuerdos de licencia comercial y las empresas tecnológicas que pretenden recopilar datos libremente para entrenar modelos de lenguaje de gran escala. Este cambio sugiere una reevaluación de cómo se valora y monetiza el contenido digital en la era de la inteligencia artificial. La adopción generalizada de estas medidas de bloqueo indica que casi una quinta parte de los sitios web más importantes del mundo se resisten a la extracción de datos sin regulación. Aunque algunas plataformas siguen apoyando el uso abierto de datos para el desarrollo de IA, la resistencia proveniente de diversos sectores demuestra una clara demanda de consentimiento y compensación. Esta tendencia cuestiona la suposición de que el contenido web de acceso público es inherentemente gratuito para el entrenamiento comercial de IA sin permiso. Este desarrollo es crucial para los defensores de los datos abiertos, ya que señala un posible retroceso frente a la recolección masiva y sin restricciones de datos que impulsó los recientes avances en IA. Hace hincapié en la necesidad de políticas transparentes sobre el origen de los datos y plantea interrogantes sobre los marcos legales que regulan la información digital. Comprender esta resistencia es esencial para navegar el futuro de los datos abiertos, donde el acceso debe equilibrar la innovación con los derechos de los creadores de contenido.

Fuente: rappler.com
Publicado el 2023-09-07