The Fight Against AI Comes to a Foundational Data Set

Los medios de comunicación daneses han presionado con éxito a la organización sin fines de lucro Common Crawl para que elimine sus artículos protegidos por derechos de autor y bloquee futuros rastros, citando preocupaciones sobre el uso de su contenido por parte de empresas de inteligencia artificial. Esta acción, liderada por la Alianza de Derechos Danesa, refleja movimientos similares de grandes editoriales como The New York Times, que consideran el conjunto de datos web extraídos como un recurso crítico y no autorizado que alimenta los modelos de IA generativa. La inmediata conformidad de Common Crawl destaca la vulnerabilidad de las pequeñas entidades sin fines de lucro frente a amenazas legales de poderosas corporaciones mediáticas, incluso cuando estas eliminaciones contradicen la misión de la organización de preservar la historia de la web abierta. El rápido cambio de política marca un punto de inflexión significativo para Common Crawl, que fue establecido originalmente como una herramienta de investigación de nicho mucho antes del actual auge de la IA. Anteriormente intocable por la aplicación de derechos de autor, la organización ahora está gestionando una oleada de solicitudes de rectificación y enfrentando barreras técnicas crecientes, con un porcentaje cada vez mayor de sitios de noticias importantes bloqueando explícitamente su rastreador. Esta tendencia ilustra cómo la infraestructura de la web abierta, una vez utilizada principalmente para investigación académica y técnica, se está volviendo cada vez más fragmentada a medida que las editoriales intentan proteger sus activos de los esfuerzos de recopilación de datos para el entrenamiento de IA. Este conflicto subraya una tensión fundamental en el ecosistema de datos abiertos entre la preservación de la información pública y la protección de la propiedad intelectual. A medida que las editoriales restringen cada vez más el acceso a su contenido, la integridad y neutralidad de los archivos web públicos se ven comprometidas, potencialmente borrando registros históricos y obstaculizando la investigación independiente. La situación plantea preguntas críticas sobre la sostenibilidad de las iniciativas de datos abiertos cuando se enfrentan a presiones comerciales, sugiriendo que el libre flujo de información necesario para la transparencia y la innovación puede ser sacrificado para proteger los intereses de derechos de autor en la era de la inteligencia artificial.

Source: wired.com
Published on 2024-06-14