OpenAI's GPTBot and other AI web crawlers are being blocked by even more companies now

OpenAI's GPTBot and other AI web crawlers are being blocked by even more companies now

Se está produciendo un cambio significativo en la accesibilidad de los datos en la web, ya que las principales plataformas en línea están bloqueando cada vez más a los rastreadores web de inteligencia artificial (IA) para proteger su información propietaria. Esta resistencia frente al raspado automatizado de datos refleja una creciente preocupación corporativa por el uso no autorizado del contenido web para entrenar modelos de inteligencia artificial generativa. Sitios web destacados están implementando activamente medidas técnicas para restringir el acceso a estos bots, que alimentan a los modelos de lenguaje de gran escala. Como consecuencia, el volumen de datos públicos disponibles para el desarrollo de IA está disminuyendo, lo que obliga a los desarrolladores a depender más de conjuntos de datos con licencia o propietarios, en lugar de basarse en el contenido web obtenido mediante raspado gratuito. Esta tendencia es altamente relevante para los datos abiertos, ya que cuestiona la suposición de que la web pública sigue siendo un recurso compartido y accesible para la reutilización de la información. A medida que más sitios imponen restricciones, el ideal de disponibilidad universal de datos enfrenta obstáculos prácticos, lo que podría limitar la transparencia y la innovación que dependen del acceso sin restricciones a la información digital.

Fuente: businessinsider.com
Publicado el 2023-09-29