AI giants like OpenAI and Anthropic are scrambling to get their hands on enough data to train models

AI giants like OpenAI and Anthropic are scrambling to get their hands on enough data to train models

Los principales desarrolladores de inteligencia artificial buscan con urgencia datos de alta calidad, ya que una escasez crítica amenaza con frenar el avance de los modelos de lenguaje de gran escala. La teoría del sector sostiene que materiales de entrenamiento superiores se correlacionan directamente con salidas más precisas y capaces. Sin embargo, con la demanda prevista para superar ampliamente la oferta de texto generado por humanos y fiable hacia finales de esta década, las empresas enfrentan importantes obstáculos para mantener su ventaja competitiva y mejorar la calidad de sus productos. Esta escasez proviene de limitaciones fundamentales en el ecosistema digital disponible. Gran parte de la internet pública consiste en texto fragmentado o defectuoso, mientras que la proliferación de contenido generado por IA arriesga provocar un "colapso del modelo" a través de la contaminación de datos. Además, estrictas regulaciones de derechos de autor y privacidad han llevado a las principales plataformas a restringir el acceso a su contenido. En consecuencia, las compañías se ven obligadas a explorar fuentes alternativas, como transcripciones de video, y están experimentando con la generación de datos sintéticos para sortear estos cuellos de botella tradicionales y asegurar el material de entrenamiento necesario. Esta crisis es altamente relevante para el movimiento de datos abiertos, destacando la fragilidad de depender de datos web raspados y no regulados para el entrenamiento de modelos. A medida que las corporaciones se orientan hacia mercados de datos de pago y alternativas sintéticas, el debate sobre el origen de los datos, las licencias y la compensación equitativa se intensifica. El posible alejamiento de modelos masivos y monolíticos sugiere que el futuro progreso de la IA podría depender menos del volumen bruto de datos y más de la curación de información confiable, transparente y obtenida éticamente, reforzando la importancia de estándares robustos de datos abiertos.

Fuente: businessinsider.com
Publicado el 2024-04-02