DatologyAI is building tech to automatically curate AI training data sets | TechCrunch
El entrenamiento de modelos de lenguaje grandes se ve gravemente obstaculizado por la complejidad y el sesgo inherentes a los conjuntos de datos masivos y no curados. La preparación de datos consume una parte significativa del tiempo de los científicos de datos y determina directamente el rendimiento, la eficiencia y la equidad de los modelos. Los datos mal curados dan lugar a sistemas de inteligencia artificial ineficientes, costosos y potencialmente sesgados, lo que crea un cuello de botella crítico para las organizaciones que buscan implementar soluciones efectivas de IA generativa. Para abordar este problema, DatologyAI ha desarrollado herramientas automatizadas que identifican, aumentan y estructuran datos de alto valor para el entrenamiento. Al distinguir qué puntos de datos son más relevantes para aplicaciones específicas, la plataforma tiene como objetivo reducir los tiempos de entrenamiento y los costos computacionales, al tiempo que mejora la precisión de los modelos. Este enfoque permite a las empresas aprovechar de manera más efectiva sus reservas de datos existentes, transformando la información bruta en conjuntos de datos optimizados que producen modelos de IA más pequeños, rápidos y especializados, sin necesidad de realizar una intensa labor manual. Este desarrollo es altamente relevante para los datos abiertos, ya que aborda el problema del "basura entra, basura sale" que afecta a los conjuntos de entrenamiento de IA de código abierto y de acceso público. A medida que la comunidad de IA depende cada vez más de los datos abiertos para garantizar la transparencia y la reproducibilidad, es esencial asegurar que estos datos sean limpios y representativos. Las herramientas de curación automatizada pueden ayudar a democratizar el acceso a recursos de entrenamiento de alta calidad, reduciendo la barrera de entrada para entidades más pequeñas y contribuyendo a mitigar los sesgos que suelen encontrarse en los conjuntos de datos públicos a gran escala.
Source: techcrunch.comPublished on 2024-02-23