Search engines that don’t pay up can’t index Reddit content
La reciente aplicación por parte de Reddit de su política de robots.txt ha extendido, ya sea de forma inadvertida o intencional, más allá de los desarrolladores de chatbots de inteligencia artificial, para incluir a motores de búsqueda importantes como Bing y DuckDuckGo. Mientras Google sigue siendo el único motor de búsqueda principal capaz de indexar el contenido de Reddit, probablemente debido a un lucrativo acuerdo de licencia, los competidores están bloqueados por negarse a aceptar términos que prohíben el uso de los datos extraídos para el entrenamiento de IA. Esta medida crea efectivamente un jardín amurallado donde Google mantiene un monopolio sobre el vasto repositorio de contenido generado por los usuarios de Reddit en los resultados de búsqueda, aislando a las plataformas rivales que cumplen con las normas estándar de privacidad en la web. Este desarrollo tiene implicaciones significativas para la web abierta, ya que demuestra cómo las corporaciones están aprovechando controles técnicos para restringir la accesibilidad de los datos y monetizar el contenido exclusivamente a través de asociaciones selectivas. El incidente pone de manifiesto una creciente tensión entre la naturaleza tradicionalmente abierta de Internet, que depende del rastreo abierto para la buscabilidad, y la realidad emergente del acaparamiento de datos impulsado por el alto valor de los datos de entrenamiento para la inteligencia artificial. Al establecer condiciones estrictas para el acceso, Reddit no solo está protegiendo a sus usuarios, sino también remodelando el ecosistema digital para favorecer a las entidades dispuestas a pagar por los derechos de los datos. Para la comunidad de datos abiertos, este caso sirve como una advertencia crítica sobre la fragilidad de la accesibilidad web en la era de la IA. Ilustra cómo entidades individuales pueden imponer condiciones que fragmentan la indexación universal de la web, lo que potencialmente podría llevar a un Internet fragmentado donde la información solo esté disponible para aquellos que puedan permitirse acuerdos legales o comerciales. La situación subraya la urgente necesidad de marcos legales más claros y estándares éticos en relación con el raspado de datos, para prevenir la erosión del intercambio abierto de información y asegurar que los beneficios del desarrollo de la IA no se consigan a costa de la apertura de la web.
Source: engadget.comPublished on 2024-07-25
Related news
- After AgentGPT's success, Reworkd pivots to web-scraping AI agents | TechCrunch
- The tech industry can’t agree on what open-source AI means. That’s a problem.
- Mark Zuckerberg Argues That 'Open Source AI' Is The Path Forward
- The open-source AI boom is built on Big Tech’s handouts. How long will it last?
- Researchers have discovered AI’s worst enemy — its own data