Researchers have discovered AI’s worst enemy — its own data

Investigaciones recientes identifican una vulnerabilidad crítica en los modelos de lenguaje grandes, conocida como "colapso del modelo". Cuando los sistemas de inteligencia artificial se entrenan principalmente con datos generados por otros modelos de IA, experimentan un proceso degenerativo en el que pierden la diversidad del conjunto de datos original. Esto ocurre porque los modelos tienden a sobre-representar los patrones comunes mientras olvidan los elementos poco frecuentes, lo que genera un bucle de retroalimentación que distorsiona la realidad. Con el tiempo, esto da lugar a repeticiones de texto sin sentido y a una percepción errónea significativa de los hechos, ya que los modelos propagan sus propios errores en lugar de aprender del conocimiento genuino de los seres humanos. Las implicaciones para el avance del aprendizaje automático son profundas, ya que este fenómeno sugiere que el progreso podría ralentizarse debido a datos de entrenamiento cada vez más ruidosos y degradados. Aunque los principales proveedores actuales mitigan los riesgos inmediatos mediante evaluaciones humanas rigurosas y el uso de puntos de control (checkpoints), la amenaza a largo plazo persiste si Internet se satura de contenido sintético. El problema central no radica en el uso de texto generado por IA per se, sino en la falta de filtrado, lo que permite que estos modelos envenenen inadvertidamente a las generaciones posteriores. Esto destaca una inevitabilidad estadística que afecta a todas las arquitecturas de manera similar, planteando un riesgo sistémico para la escalabilidad de los futuros desarrollos de IA. Este hallazgo es altamente relevante para los datos abiertos, ya que subraya el valor insustituible del contenido auténtico, creado por seres humanos, para entrenar sistemas de IA robustos. A medida que el texto generado por IA inunda las plataformas en línea, la distinción entre fuentes humanas y máquinas se difumina, lo que podría degradar la calidad de los conjuntos de datos públicos. En consecuencia, preservar y utilizar fuentes de alta calidad centradas en el ser humano, como los foros impulsados por la comunidad, es esencial para mantener la integridad de los datos. La investigación sirve como una advertencia de que, sin una curación estricta de las fuentes de datos abiertos, los cimientos del aprendizaje automático podrían volverse inestables, convirtiendo el origen de los datos de entrenamiento en una preocupación crítica tanto para los desarrolladores como para los responsables de la gestión de datos.

Source: tomsguide.com
Published on 2024-07-25