Amazon Is Investigating Perplexity Over Claims of Scraping Abuse
Amazon Web Services (AWS) ha iniciado una investigación sobre Perplexity AI, para determinar si la startup infringe las normas de alojamiento en la nube al ignorar los estándares web que restringen el raspado de datos. Esta investigación se deriva de informes que indican que los sistemas de Perplexity accedieron a contenido de importantes sitios de noticias, como WIRED y The New York Times, a pesar de que estos editores prohíben explícitamente el acceso automatizado mediante el Protocolo de Exclusión de Robots (Robots Exclusion Protocol). Aunque este protocolo no tiene carácter jurídicamente vinculante, AWS exige su cumplimiento para prevenir actividades abusivas, lo que convierte este caso en una prueba crítica de cómo los proveedores de servicios en la nube hacen cumplir los estándares éticos de uso de datos entre sus clientes. La situación pone de manifiesto la creciente tensión entre el desarrollo de la inteligencia artificial y la propiedad del contenido, ya que Perplexity afirma que su infraestructura respeta estos protocolos, pero se descubrió que los eludía mediante servidores no divulgados. La startup atribuye parte de esta actividad a rastreadores (crawlers) de terceros y argumenta que ignorar las restricciones es a veces necesario para responder a las consultas de los usuarios, una postura que desafía las normas tradicionales de la web. Este conflicto subraya la ambigüedad en la regulación de la recopilación de datos por parte de la IA, donde las capacidades técnicas suelen ir por delante de los marcos legales y contractuales establecidos para proteger los derechos de los editores y la integridad de los servidores. Este caso es altamente relevante para el movimiento de datos abiertos, ya que expone el frágil equilibrio entre el acceso libre a la información y la distribución controlada de los activos digitales. Plantea preguntas sobre quién controla la disponibilidad de los datos cuando entidades privadas utilizan infraestructuras potentes para eludir las restricciones públicas. El resultado probablemente influirá en las políticas futuras sobre el raspado de datos, afectando potencialmente la forma en que se obtienen, preservan y acceden los conjuntos de datos abiertos en una era en la que las empresas de IA dependen cada vez más de la información pública agregada para entrenar sus modelos.
Source: wired.comPublished on 2024-06-28