Google strikes $60m deal with Reddit for AI training data — what you need to know

Reddit y Google han cerrado un acuerdo significativo que otorga al gigante tecnológico acceso a la API de datos de Reddit. Esta asociación permite a Google utilizar contenido estructurado en tiempo real para mejorar sus productos y entrenar modelos de inteligencia artificial generativa. A cambio, Reddit obtiene acceso al servicio Vertex AI de Google, con el objetivo de mejorar sus capacidades de búsqueda interna y mostrar resultados más centrados en el contenido en las plataformas de Google. Aunque este acuerdo asegura ingresos sustanciales para Reddit, pone de manifiesto una tensión crítica en el desarrollo de la IA en relación con la calidad de los datos. El contenido generado por los usuarios en Reddit, informal, sin filtrar y predominantemente masculino, ofrece una perspectiva distintiva sobre la comunicación humana. Sin embargo, los críticos argumentan que estos datos constituyen una muestra de entrenamiento imperfecta en comparación con las publicaciones formales, lo que podría introducir sesgos o imprecisiones en los sistemas de IA. Este contraste subraya las complejas compensaciones entre escala, diversidad y fiabilidad factual en los conjuntos de datos de aprendizaje automático. Este acuerdo es altamente relevante en las discusiones sobre datos abiertos, ya que marca un cambio desde la extracción no compensada hacia el acceso con licencia. Señala que las empresas de IA ya no pueden cosechar libremente el contenido generado por los usuarios sin abordar las preocupaciones legales y éticas. A medida que aumentan las demandas contra las principales empresas tecnológicas por el entrenamiento no autorizado, este acuerdo ilustra la norma emergente en la que la propiedad de los datos se reconoce como un activo valioso, requiriendo permiso explícito y una compensación justa.

Source: tomsguide.com
Published on 2024-02-24