Experts warn AI is running out of training data
Los expertos predicen que el agotamiento acelerado de los datos de alta calidad generados por humanos para entrenar modelos de lenguaje grandes podría restringir severamente el desarrollo de la inteligencia artificial (IA) para 2026. Esta escasez amenaza con estancar el crecimiento de sistemas sofisticados de IA, lo que podría impactar billones de dólares en beneficios económicos proyectados y limitar las capacidades de herramientas que están cada vez más integradas en la vida cotidiana y la industria. La urgencia de este problema destaca una dependencia crítica en los ecosistemas de datos abiertos. Gran parte del material digital disponible para entrenamiento consiste en información compartida públicamente o extraída mediante raspado web; a medida que este reservorio se agota, la comunidad de datos abiertos enfrenta un cuello de botella que afecta no solo a los modelos propietarios, sino también al campo más amplio de la investigación en IA accesible. La disminución de datos diversos y de alta fidelidad, tanto de texto como de imágenes, subraya la necesidad de fuentes de datos sostenibles más allá del corpus actual de Internet. Sin embargo, se espera que la industria se adapte mediante innovaciones algorítmicas en lugar de la simple acumulación de datos. Técnicas como la Mezcla de Expertos (Mixture of Experts) y mejoras en los embeddings buscan extraer más valor de los conjuntos de datos existentes, permitiendo que los modelos logren un mayor rendimiento con menos materia prima. Para los defensores de los datos abiertos, este cambio enfatiza la importancia de la calidad de los datos, los metadatos y la eficiencia en las tuberías de entrenamiento, por encima del volumen, asegurando que los futuros avances en IA sigan siendo viables incluso a medida que la información fácilmente accesible se vuelva escasa.
Source: technology.inquirer.netPublished on 2023-11-21