AI 'gold rush' for chatbot training data could run out of human-written text - ET Telecom

AI 'gold rush' for chatbot training data could run out of human-written text - ET Telecom

Investigaciones recientes indican que el crecimiento exponencial de la inteligencia artificial se enfrenta a un inminente cuello de botella, ya que se prevé que los datos públicos de texto generados por humanos y de alta calidad se agoten a principios de la década de 2030. Esta "escasez de datos" amenaza el paradigma actual de escalar los modelos de lenguaje simplemente añadiendo más información, lo que obliga a las empresas tecnológicas a competir ferozmente por las fuentes valiosas restantes, como los medios de comunicación y las plataformas de redes sociales. Sin nueva entrada humana, la industria podría tener dificultades para mantener su rápido ritmo de innovación, lo que impulsaría un cambio hacia la compra de acceso exclusivo a datos o la exploración de alternativas a los métodos tradicionales de entrenamiento. En ausencia de nuevo contenido humano, los desarrolladores están cada vez más tentados a utilizar datos sintéticos generados por modelos de inteligencia artificial existentes. Sin embargo, los expertos advierten que este enfoque conlleva el riesgo de un "colapso del modelo", donde el entrenamiento iterativo sobre salidas generadas por IA degrada la calidad y amplifica los sesgos y errores existentes. Esta dependencia de datos sintéticos imperfectos destaca una limitación crítica en las estrategias tecnológicas actuales, sugiriendo que simplemente aumentar la potencia computacional o reutilizar datos existentes no es suficiente para sostener el progreso a largo plazo en las capacidades y la fiabilidad de los modelos. Esta narrativa es altamente relevante para la comunidad de datos abiertos, ya que subraya el valor existencial de la información pública de alta calidad y de libre acceso. Si el ecosistema abierto de Internet se agota para el entrenamiento de IA, podría conducir a un mayor cercamiento del conocimiento, donde los datos esenciales se vuelvan propietarios o estén sujetos a muros de pago. Además, la posible contaminación de la web con contenido sintético de baja calidad amenaza la integridad de repositorios abiertos como Wikipedia. Por lo tanto, los defensores de los datos abiertos deben enfatizar la preservación de las contribuciones auténticas de los humanos y la importancia de la obtención ética de datos para prevenir el colapso del bien común del conocimiento público que sustenta el desarrollo moderno de la inteligencia artificial.

Fuente: telecom.economictimes.indiatimes.com
Publicado el 2024-06-08