Websites can now block OpenAI's web crawling bot

Websites can now block OpenAI's web crawling bot

OpenAI ha respondido a las amplias críticas sobre su uso de datos de acceso público para entrenar a ChatGPT, proporcionando a los webmasters mecanismos claros para optar por no participar. La compañía reconoce su dependencia del contenido extraído de Internet, pero enfatiza que la participación voluntaria mejora la precisión y la seguridad del modelo. Este enfoque equilibra la necesidad de datos de entrenamiento exhaustivos con el respeto a las preferencias individuales y corporativas respecto a sus activos digitales. Al emitir directrices específicas sobre el uso del protocolo robots.txt, OpenAI empodera a los propietarios de sitios web para bloquear a su rastreador, GPTBot, de acceder a sus sitios. Esta medida ofrece un mayor control en comparación con las alternativas existentes, siempre que la compañía cumpla estrictamente con las reglas de exclusión que promueve. La transparencia sobre la identidad del rastreador y sus especificaciones técnicas se presenta como un paso clave hacia prácticas éticas de recopilación de datos en el panorama de la IA en rápida evolución. Este desarrollo es altamente relevante para los datos abiertos, ya que destaca la tensión entre la naturaleza abierta de la web y las demandas propietarias de los modelos de IA comerciales. Subraya la creciente necesidad de marcos estandarizados y transparentes que permitan a los creadores de contenido mantener la soberanía sobre sus contribuciones. Además, la alineación de OpenAI con compromisos voluntarios de seguridad sugiere un cambio hacia un compromiso más responsable con el ecosistema de datos abiertos, lo que podría influir en cómo los futuros sistemas de IA interactúan con la información de acceso público.

Fuente: techspot.com
Publicado el 2023-08-10