Breaking MAD: Generative AI could break the internet, researchers find

Una investigación de la Universidad Rice revela que confiar en datos sintéticos para entrenar las siguientes generaciones de IA crea un peligroso bucle de retroalimentación, lo que da lugar al "Trastorno de Autofagia de Modelos". Este fenómeno provoca una degradación progresiva de los modelos, dando como resultado salidas corruptas que carecen tanto de calidad como de diversidad. A medida que los sistemas de IA consumen cada vez más su propio contenido generado sin una entrada suficiente procedente de fuentes del mundo real, se dañan de forma irreversible, reflejando la degradación observada en la autofagia biológica. El estudio demuestra que, aunque una mezcla de datos reales y sintéticos puede mitigar estos efectos, una dieta compuesta principalmente por datos sintéticos conduce inevitablemente al "colapso del modelo". Sin la introducción de información fresca y auténtica, los modelos de IA generan un aumento de artefactos y homogeneidad, volviéndose inútiles con el tiempo. Esto destaca una dependencia crítica de datos generados por humanos de alta calidad para mantener la salud y la utilidad de los sistemas de IA generativa. Este hallazgo es fundamental para el movimiento de datos abiertos, ya que subraya el valor insustituible de los conjuntos de datos auténticos y accesibles públicamente. Advierte que la proliferación sin regulación del contenido generado por IA podría envenenar el ecosistema digital, haciendo esencial la preservación y el intercambio abierto de datos del mundo real. Para prevenir la degradación a largo plazo de las tecnologías de IA, la comunidad debe priorizar el mantenimiento de fuentes robustas de conocimiento humano genuino, en lugar de permitir que bucles cerrados de generación sintética dominen los procesos de entrenamiento.

Source: sciencedaily.com
Published on 2024-08-01