AI companies are finally being forced to cough up for training data

El panorama de la inteligencia artificial está experimentando un cambio fundamental a medida que llega a su fin la era del raspado web no regulado. Las principales demandas presentadas por creadores y organizaciones mediáticas ponen de manifiesto que los datos de alta calidad para el entrenamiento ya no son un recurso gratuito. Esta reacción legal obliga a las empresas de inteligencia artificial a buscar el consentimiento explícito y la compensación correspondiente, estableciendo un nuevo precedente en el que los propietarios de los datos poseen una influencia significativa. Este cambio cuestiona la suposición previa de la industria de que el contenido en línea público podía utilizarse indiscriminadamente para entrenar modelos generativos. Esta transición hacia el acceso a datos con licencia tiene implicaciones complejas para el ecosistema de datos abiertos. Si bien introduce mecanismos de consentimiento necesarios y permite que los titulares de derechos se beneficien del auge de la inteligencia artificial, también conlleva el riesgo de concentrar el poder en manos de los grandes actores establecidos, que pueden permitirse costosos acuerdos de licencia. Los actores más pequeños podrían tener dificultades para acceder a los datos necesarios para competir, lo que podría frenar la innovación. Además, la promesa de sistemas de citación transparentes enfrenta obstáculos técnicos inherentes, ya que los modelos de lenguaje a menudo tienen dificultades con la precisión factual, lo que hace difícil verificar el cumplimiento de estos nuevos estándares éticos. En última instancia, este desarrollo es relevante para los datos abiertos porque redefine los límites de la propiedad de los datos y los derechos de uso. El paso del raspado abierto al intercambio con licencia sugiere un futuro en el que la privacidad de los datos y la propiedad intelectual se aplicarán de manera estricta. Este cambio fomenta el desarrollo de economías de datos más justas, donde las personas y las organizaciones conservan la capacidad de decisión sobre sus contribuciones. Impulsa a la comunidad a considerar cómo el acceso a los datos puede ser tanto legalmente conforme como equitativo, alejándose de la expansión caótica inicial de los conjuntos de datos de entrenamiento de la inteligencia artificial hacia un modelo más sostenible y respetuoso de utilización de datos.

Source: technologyreview.com
Published on 2024-07-17