John Battelle's Search Blog What’s SearchGPT Really About? Moving Past the Training Data Dilemma.

El lanzamiento de SearchGPT por parte de OpenAI parece menos una amenaza competitiva genuina para los motores de búsqueda establecidos y más una maniobra estratégica para mitigar la intensa reacción negativa respecto a sus prácticas de entrenamiento con datos. Ante la significativa presión que ejerce la empresa por parte de editores y gobiernos debido al raspado no autorizado de la web, este movimiento sirve principalmente para reparar su imagen pública y tranquilizar a los proveedores de contenido, demostrando que valora sus contribuciones. El anuncio enfatiza características como la atribución destacada y los enlaces, con el objetivo de demostrar una relación simbiótica con el periodismo. Al presentar la herramienta como un prototipo temporal, separado de sus modelos generativos principales, OpenAI intenta distinguir entre la funcionalidad de búsqueda y el entrenamiento de los modelos. Esta distinción es crucial para alentar a los editores a permitir que sus sitios permanezcan accesibles para la indexación en buscadores, manteniendo así su suministro de datos de entrenamiento de alta calidad a pesar de las controversias en curso. Este desarrollo es altamente relevante para la comunidad de datos abiertos, ya que pone de manifiesto la tensión entre la indexación libre de la web y el acceso controlado a los datos. Subraya cómo las grandes entidades tecnológicas están adoptando cada vez más modelos basados en la atribución para legitimar la extracción de datos. Comprender estos cambios es vital para los defensores de los datos abiertos, pues revela la creciente presión para formalizar los permisos y la procedencia, lo que podría afectar la naturaleza libre y abierta de la web al priorizar fuentes de datos con licencia o consentimiento.

Source: battellemedia.com
Published on 2024-07-27