OpenAI just admitted it has a bot that crawls the web to collect AI training data. If you don't block GPTbot, that's self-sabotage.

OpenAI just admitted it has a bot that crawls the web to collect AI training data. If you don't block GPTbot, that's self-sabotage.

El auge de la inteligencia artificial generativa está desmantelando el modelo económico fundamental de la web abierta, en el que los motores de búsqueda proporcionaban tráfico a los creadores a cambio de contenido indexado. A diferencia de los rastreadores web tradicionales, que redirigen a los usuarios hacia las fuentes originales, los modelos de lenguaje de gran escala satisfacen las consultas directamente, eliminando el incentivo para que individuos y editores compartan información libremente. Este cambio amenaza la sostenibilidad del ecosistema de contenidos de Internet al privar a los creadores de la visibilidad y los ingresos potenciales que antes sostenían su trabajo. En consecuencia, la confianza entre los productores de datos y los desarrolladores de IA se está erosionando, ya que los creadores se dan cuenta de que sus contribuciones están siendo extraídas sin compensación ni consentimiento. Muchos están bloqueando activamente a los bots de IA para proteger su propiedad intelectual, argumentando que el actual sistema de "opt-out" (exclusión voluntaria) permite que las corporaciones exploten material con derechos de autor antes de que los creadores siquiera sean conscientes de la infracción. La incapacidad para eliminar los datos ya extraídos exacerba esta frustración, lo que lleva a demandas generalizadas por un estricto marco de "opt-in" (consentimiento previo), donde el permiso se otorgue antes de cualquier recopilación de datos. Esta situación es críticamente relevante para los defensores de los datos abiertos, porque destaca un precedente peligroso en el que los intereses propietarios eclipsan el acceso público y los derechos de los creadores. La extracción descontrolada de la web socava la recolección ética de la información pública y desafía la transparencia esencial para prácticas de datos confiables. Si las empresas de IA continúan priorizando la extracción ilimitada de datos sobre el otorgamiento justo de licencias, la integridad de la web abierta —y los principios de datos abiertos que dependen de ella— enfrentan una degradación significativa.

Fuente: businessinsider.com
Publicado el 2023-08-09