Reddit to update web standard to block automated website scraping

Reddit está endureciendo las restricciones sobre el raspado automatizado de datos al actualizar su protocolo robots.txt para impedir que las empresas de inteligencia artificial eludan las bloqueos existentes. Esta medida aborda las crecientes preocupaciones de que las firmas de IA están recopilando contenido de los editores sin autorización para entrenar sus modelos, sin el permiso adecuado ni la atribución correspondiente, tratando efectivamente la información propietaria como un recurso gratuito. La plataforma aplicará límites de velocidad más estrictos y bloqueará a los rastreadores desconocidos, con el objetivo de detener la replicación no acreditada del material generado por los usuarios. Si bien los investigadores y las instituciones de archivo conservan el acceso con fines no comerciales, las entidades comerciales enfrentan barreras de entrada significativamente más altas, lo que marca un cambio hacia la protección de los activos digitales contra la extracción indiscriminada. Este desarrollo es crucial para los datos abiertos, ya que pone de manifiesto la tensión entre el flujo de información sin restricciones y la propiedad del contenido. Obliga a la comunidad a reconsiderar cómo la accesibilidad de los datos se alinea con los estándares éticos, influyendo potencialmente en las normas futuras en torno a los datos de entrenamiento algorítmico y los marcos legales que rigen los derechos de contenido digital.

Source: asiaone.com
Published on 2024-06-27