The AI world's most valuable resource is running out, and it's scrambling to find an alternative: 'fake' data

La industria de la inteligencia artificial enfrenta una crisis crítica de escasez de datos, ya que la oferta de contenido generado por humanos de alta calidad disminuye, lo que impulsa un rápido cambio hacia los datos sintéticos como recurso principal de entrenamiento. Esta transición está motivada por el agotamiento de los datos web públicamente disponibles y por el aumento de las restricciones al raspado de datos (web scraping), lo que obliga a las principales empresas tecnológicas a buscar fuentes alternativas para sostener el desarrollo de sus modelos y evitar estancamientos en el rendimiento. Sin embargo, depender exclusivamente de datos sintéticos conlleva riesgos significativos, como el «colapso del modelo», en el que los sistemas se degradan y producen salidas incoherentes debido al entrenamiento recursivo sobre sus propias generaciones defectuosas. Para mitigar este problema, los expertos abogan por un enfoque híbrido que equilibre las entradas sintéticas con datos verificados del mundo real. Esta estrategia busca preservar la integridad y las capacidades de razonamiento de los modelos, al tiempo que aprovecha los datos sintéticos para cubrir vacíos específicos, reducir sesgos y abordar preocupaciones relacionadas con la privacidad. Esta dinámica es fundamental en los debates sobre datos abiertos, ya que pone de manifiesto la tensión entre el control propietario y la sostenibilidad de los ecosistemas de conocimiento público. A medida que los datos sintéticos se convierten en la nueva norma, el origen y la calidad de los datos de entrenamiento probablemente se vuelvan aún más controvertidos, lo que podría acelerar el impulso hacia conjuntos de datos abiertos, transparentes y obtenidos de manera ética, con el fin de evitar que los sistemas de inteligencia artificial se vuelvan insulares o se desconecten de una realidad verificable.

Source: businessinsider.com
Published on 2024-08-10