OpenAI, Google, and Anthropic hit the critical knowledge cap for advanced AI training—Is AGI still in the ChatGPT maker's pipeline in the next five years?

Los principales desarrolladores de inteligencia artificial (IA) se enfrentan a importantes cuellos de botella en la creación de modelos de próxima generación, principalmente debido a la escasez de datos de entrenamiento de alta calidad y a los costos prohibitivos. Líderes de la industria como OpenAI, Google y Anthropic han descubierto que el contenido disponible en Internet no es suficiente para mejorar capacidades críticas, como la competencia en programación, lo que ha llevado a un rendimiento decepcionante en los sistemas más nuevos en comparación con sus predecesores. Esta escasez obliga a las empresas a depender de infraestructura costosa y de inyecciones de capital, lo que tensiona su sostenibilidad financiera y retrasa el lanzamiento de productos. La dependencia del raspado de información públicamente disponible ha desatado intensas batallas legales y éticas en torno al derecho de autor. Aunque algunos tribunales han fallado en contra de los editores que alegan daños financieros por el uso no autorizado de datos, el conflicto más amplio pone de manifiesto la tensión entre la propiedad del contenido privado y la disponibilidad abierta de la información necesaria para el aprendizaje automático. Este panorama legal genera incertidumbre entre los desarrolladores, quienes reconocen que entrenar modelos avanzados sin acceder a conjuntos de datos tan vastos es actualmente imposible, lo que cuestiona los métodos actuales de adquisición de datos y las normas de propiedad intelectual. Esta situación es altamente relevante para los datos abiertos, ya que subraya la necesidad crítica de conjuntos de datos diversos, de alta calidad y obtenidos de manera ética para impulsar el desarrollo de la IA. A medida que las empresas luchan contra la escasez de datos y las disputas por derechos de autor, la comunidad de datos abiertos ofrece una alternativa potencial al proporcionar recursos accesibles, con licencia o de dominio público. Facilitar la creación de conjuntos de datos abiertos robustos podría ayudar a mitigar las limitaciones de recursos y los riesgos legales que actualmente obstaculizan la innovación, convirtiendo a los datos abiertos en un componente vital para el futuro de la investigación en IA sostenible y transparente.

Source: windowscentral.com
Published on 2024-11-14