Tech companies are turning to ‘synthetic data’ to train AI models – but there’s a hidden cost - EconoTimes

El artículo sostiene que el suministro de datos generados por humanos para entrenar la inteligencia artificial está llegando a su límite, lo que obliga a la industria a depender cada vez más de datos sintéticos. Si bien los datos reales ofrecen autenticidad, son escasos, requieren un esfuerzo considerable para su curación y, con frecuencia, contienen sesgos o errores. Este cambio es crucial porque la calidad de los datos de entrenamiento determina directamente la precisión y la fiabilidad de los resultados de la IA, por lo que la transición hacia contenidos creados por humanos, cada vez más escasos, se convierte en una necesidad operativa urgente y no en una simple opción. Los datos sintéticos presentan una solución viable debido a su disponibilidad ilimitada y su capacidad para abordar preocupaciones relacionadas con la privacidad; sin embargo, introducen riesgos significativos, como el colapso del modelo y la propagación de alucinaciones. Si los modelos de IA se entrenan exclusivamente con salidas sintéticas defectuosas o excesivamente simplificadas, su rendimiento se degradará, dando lugar a sistemas menos útiles. En consecuencia, la implicación fundamental es que los datos sintéticos no pueden simplemente sustituir a los datos reales; deben gestionarse cuidadosamente para evitar la degradación de la inteligencia y garantizar que los sistemas de IA sigan siendo robustos y confiables. Para mitigar estos riesgos, el artículo hace hincapié en la necesidad de una supervisión rigurosa, estándares internacionales y un seguimiento exhaustivo de los metadatos para validar las fuentes y la calidad de los datos. Los seres humanos deben mantener el control sobre el proceso de entrenamiento, utilizando algoritmos para auditar las salidas sintéticas frente a referencias del mundo real. Este enfoque es relevante para el movimiento de datos abiertos, ya que destaca la necesidad de transparencia y trazabilidad de los datos en la era de la generación algorítmica. Garantizar que los datos sintéticos sean verificables y obtenidos de manera ética respalda los principios más amplios de los datos abiertos, como la rendición de cuentas, la accesibilidad y la confianza, elementos esenciales para mantener la confianza del público en las tecnologías emergentes de IA.

Source: econotimes.com
Published on 2025-01-15