Data Shortage for AI Training Looms by 2026, Warn Researchers

El rápido avance de la inteligencia artificial se ve cada vez más amenazado por la escasez de datos de entrenamiento de alta calidad, ya que los repositorios en línea existentes se están agotando más rápido de lo que los modelos de IA los consumen. Este cuello de botella representa un riesgo significativo para el crecimiento continuo de los modelos de lenguaje grandes y otros sistemas de IA, pudiendo alterar la trayectoria de la innovación tecnológica y su impacto económico. El problema central radica en la distinción entre el volumen bruto de información disponible y la necesidad de contenido limpio, libre de sesgos y cuidadosamente curado, dado que las fuentes de baja calidad suelen introducir sesgos dañinos o imprecisiones en algoritmos sofisticados. Este artículo es de vital relevancia para el movimiento de datos abiertos, pues destaca la urgente necesidad de transitar desde el raspado web gratuito hacia modelos sostenibles y éticos de obtención de datos. A medida que los investigadores predicen el agotamiento del texto y las imágenes de alta calidad disponibles públicamente, el campo deberá depender de datos sintetizados y contenido comercial con licencia. Este cambio subraya la importancia de establecer marcos robustos para la propiedad, la licencia y la monetización de los datos, garantizando que los proveedores de datos sean compensados de manera justa. Señala un alejamiento del acceso sin restricciones que caracterizó las prácticas tempranas de datos abiertos, hacia un ecosistema más regulado donde la calidad y la procedencia de los datos son primordiales. Para mitigar estos riesgos, los desarrolladores están explorando estrategias como mejorar la eficiencia algorítmica para requerir menos datos y utilizar conjuntos de datos sintéticos generados por IA. Estos enfoques ofrecen posibles vías para sostener la innovación sin agotar las reservas naturales de datos. Además, la interacción con repositorios fuera de línea y la negociación de acuerdos de pago con los creadores de contenido abordan el desequilibrio de poder entre las empresas tecnológicas y los creadores de datos. En última instancia, la industria debe equilibrar la demanda de conjuntos de entrenamiento extensos con las limitaciones de la disponibilidad actual de datos, priorizando la calidad, la eficiencia y una gobernanza equitativa de los datos.

Source: miragenews.com
Published on 2023-11-08