Researchers warn we could run out of data to train AI by 2026.

La rápida expansión de las capacidades de la inteligencia artificial se enfrenta a un cuello de botella crítico: el agotamiento de los datos de entrenamiento de alta calidad. Aunque el volumen de contenido en línea parece vasto, la oferta de texto e imágenes limpios y confiables crece mucho más lentamente que la demanda de la industria por grandes conjuntos de datos. Esta escasez amenaza con frenar el progreso de los modelos actuales de IA, que dependen de grandes cantidades de información matizada para funcionar con precisión y evitar la propagación de sesgos o imprecisiones presentes en fuentes de baja calidad, como las redes sociales. Para mitigar este riesgo, la industria está adoptando estrategias que maximizan los recursos existentes en lugar de simplemente acumular más datos. Los desarrolladores se están centrando en crear algoritmos más eficientes que requieran menos datos y en explorar la generación de datos sintéticos para complementar las entradas del mundo real. Además, hay un movimiento significativo hacia la licencia de contenido de editoriales y la digitalización de repositorios offline, lo que señala una transición desde el raspado abierto de datos hacia una obtención estructurada y compensada de datos para sostener el desarrollo de los modelos. Esta situación es altamente relevante para el ámbito de los datos abiertos, ya que pone de manifiesto la fragilidad de depender del contenido de internet de acceso libre para la tecnología fundamental. El impulso hacia la monetización y la restricción del acceso a los datos socava el principio de disponibilidad abierta, pudiendo crear silos de datos propietarios que obstaculizan la transparencia y la investigación independiente. Comprender este cambio es crucial para abogar por ecosistemas de datos sostenibles, éticos y accesibles que equilibren la innovación con los derechos de los creadores de contenido y el interés público.

Source: thehindu.com
Published on 2023-11-10