Beware of AI 'model collapse': How training on synthetic data pollutes the next generation

Investigaciones recientes destacan una vulnerabilidad crítica en el entrenamiento de modelos de IA generativa, conocida como "colapso del modelo". Cuando los modelos se entrenan con datos sintéticos generados por otros sistemas de IA en lugar de contenido creado por humanos, su precisión se degrada significativamente a lo largo de generaciones sucesivas. Este bucle de entrenamiento recursivo provoca que los modelos pierdan el rastro de hechos raros o complejos, dando lugar a salidas genéricas, irrelevantes y, eventualmente, absurdas que no reflejan con precisión la realidad. El fenómeno ocurre porque los datos sintéticos suelen contener errores sutiles y sesgos que se acumulan en cada iteración, distorsionando las distribuciones de probabilidad que el modelo aprende. A medida que estos conjuntos de datos "contaminados" se alimentan a nuevos modelos, la diversidad de respuestas disminuye y los modelos comienzan a alucinar secuencias improbables. Este proceso degenerativo sugiere que depender en gran medida del contenido generado por IA para futuros entrenamientos podría conducir a un fallo sistémico en la calidad de los modelos, volviéndolos inútiles para tareas complejas. Este hallazgo es altamente relevante para los datos abiertos, ya que subraya la necesidad urgente de preservar conjuntos de datos auténticos y generados por humanos para el acceso público y el entrenamiento de modelos. A medida que Internet se satura de contenido generado por IA, distinguir los datos abiertos de alta calidad del ruido sintético se vuelve cada vez más difícil. Sin mecanismos claros para identificar y retener datos genuinos creados por humanos, el ecosistema de datos abiertos corre el riesgo de ser abrumado por salidas sintéticas de baja calidad, lo que obstaculizaría el desarrollo de sistemas de IA confiables y transparentes.

Source: zdnet.com
Published on 2024-07-31