Running Out of AI Training Data? Elon Musk Claims The World Is Facing a Shortage at CES 2025

Elon Musk afirma que el suministro global de datos generados por humanos disponibles para entrenar modelos de inteligencia artificial se ha agotado prácticamente, una opinión compartida por otros líderes del sector que advierten sobre el «pico de datos». Este cuello de botella crítico amenaza el avance continuo y rápido de los modelos de lenguaje de gran escala, ya que los métodos tradicionales basados en el raspado de textos y medios creados por humanos ya no son suficientes para impulsar la innovación. El agotamiento de conjuntos de datos de alta calidad, creados por personas, representa un cambio fundamental en el panorama del desarrollo de la IA, obligando a las empresas a buscar fuentes alternativas para mantener su progreso computacional. Para abordar esta escasez, la industria está recurriendo cada vez más a datos sintéticos, en los que los sistemas de IA generan su propio material de entrenamiento mediante procesos de autoaprendizaje. Este enfoque permite a los modelos crear grandes cantidades de datos personalizados, asegurando que el desarrollo no se vea obstaculizado por la limitada naturaleza de los registros humanos existentes. Las principales empresas tecnológicas ya están adoptando estas técnicas para complementar o reemplazar los conjuntos de datos tradicionales, marcando un cambio estratégico hacia el contenido generado algorítmicamente como el nuevo estándar para entrenar sistemas de IA de próxima generación. Este desarrollo es altamente relevante para la comunidad de datos abiertos, ya que la transición hacia datos sintéticos cuestiona las nociones tradicionales de procedencia de los datos, transparencia y propiedad intelectual. Si los modelos de IA se entrenan principalmente en conjuntos de datos sintéticos generados internamente o propietarios, en lugar de en el conocimiento humano disponible públicamente, los principios fundamentales de los datos abiertos —accesibilidad y utilidad compartida— podrían verse socavados. Comprender este cambio es crucial para los defensores que dependen de la disponibilidad de datos diversos, originados por humanos, para garantizar un desarrollo de la IA equitativo y verificable.

Source: techtimes.com
Published on 2025-01-11