How to block OpenAI's new AI-training web crawler from ingesting your data
How to block OpenAI's new AI-training web crawler from ingesting your data
OpenAI ha presentado GPTBot, un rastreador web dedicado diseñado para recopilar datos de manera sistemática con el fin de entrenar sus modelos de lenguaje de gran escala. Este lanzamiento representa un cambio hacia prácticas más transparentes en la adquisición de datos, ofreciendo a los desarrolladores instrucciones claras sobre cómo permitir o restringir el acceso. Al proporcionar herramientas específicas para los propietarios de sitios web, OpenAI busca equilibrar la necesidad de contar con amplios conjuntos de datos para el entrenamiento con el respeto a las preferencias de los editores, alejándose de los métodos opacos de raspado de datos. La compañía enfatiza que permitir el acceso de GPTBot contribuye a mejorar la precisión, la seguridad y las capacidades generales de la inteligencia artificial. OpenAI afirma que emplea filtros para excluir contenido protegido por muros de pago, información personalmente identificable y textos que violen sus políticas. Este enfoque sugiere un esfuerzo por legitimar la obtención de datos mediante el filtrado de materiales sensibles o restringidos, abordando así algunas preocupaciones éticas mientras se mantiene el volumen de datos necesario para la mejora de los modelos. Este desarrollo es altamente relevante en el contexto de los datos abiertos, ya que destaca la creciente tensión entre la disponibilidad de información pública y las necesidades de entrenamiento de la inteligencia artificial propietaria. A medida que aumentan las demandas judiciales relacionadas con derechos de autor y robo de datos, el movimiento de OpenAI de ofrecer mecanismos de bloqueo a través de robots.txt representa un paso hacia un acceso a los datos negociado, en lugar de una extracción unilateral. Esto subraya la importancia crítica de estandarizar los protocolos de rastreo web para proteger las fuentes abiertas mientras se permite el avance tecnológico en una era en la que la escasez de datos y el consentimiento son desafíos legales y éticos fundamentales.
Fuente: zdnet.comPublicado el 2023-08-10
Noticias relacionadas
- Websites can now block OpenAI's web crawling bot
- OpenAI lets websites block GPTBot, a web crawler that looks for AI training data
- Organizaciones de medios de comunicación piden negociar uso de contenidos para inteligencia artificial
- Google Takes Wildly Different Stances on AI "Deepfakes" and Web Scraping