AI companies are reportedly still scraping websites despite protocols meant to block them
Se informa que las principales empresas de inteligencia artificial, incluidas Perplexity, OpenAI y Anthropic, están eludiendo los protocolos robots.txt para extraer contenido con fines de entrenamiento, lo que plantea importantes preocupaciones éticas. A pesar de sus declaraciones públicas de respetar estas señales de exclusión, investigaciones revelan que estas empresas y sus rastreadores de terceros ignoran las instrucciones de los webmasters para restringir el acceso. Esta desatención deliberada socava las normas voluntarias que los desarrolladores han utilizado desde 1994 para controlar la ingestión de datos, destacando una brecha entre las relaciones públicas corporativas y las prácticas operativas reales. Las implicaciones para los creadores de contenido son graves, ya que su propiedad intelectual está siendo extraída con mínima atribución y, en ocasiones, con imprecisiones. El liderazgo de Perplexity argumenta que el protocolo carece de fuerza legal, sugiriendo la necesidad de nuevos marcos de licenciamiento. Sin embargo, esta postura permite efectivamente una extracción de datos sin control, dejando a los editores sin recursos. La situación expone un desequilibrio de poder en el que los desarrolladores de IA priorizan el acceso sobre el consentimiento, lo que podría devaluar el periodismo original y las obras creativas que alimentan estas tecnologías. Este incidente es crucial para el discurso sobre datos abiertos, ya que ilustra el conflicto entre los principios de la web abierta y los monopolios de datos propietarios. Mientras que los defensores de los datos abiertos apoyan el libre flujo de información, este caso demuestra cómo el "scraping" abierto puede violar las restricciones explícitas de los sitios, desafiando la noción de un internet verdaderamente abierto. Obliga a una reevaluación de cómo se gestionan los derechos digitales, enfatizando que la accesibilidad técnica no equivale a permiso ético o legal. En última instancia, subraya la urgente necesidad de establecer normas claras y aplicables respecto al uso de datos en la era de la inteligencia artificial generativa.
Source: engadget.comPublished on 2024-06-23