Harvard to share dataset of 1M public domain books for AI training
Harvard to share dataset of 1M public domain books for AI training
La Universidad de Harvard está poniendo a disposición del público un millón de libros de dominio público para abordar la grave falta de diversidad en los datos utilizados actualmente para entrenar la inteligencia artificial. Esta iniciativa pone de manifiesto una brecha crítica en la que los grupos y perspectivas subrepresentados son ampliamente ignorados por los modelos existentes, lo que da lugar a resultados sesgados. Al proporcionar un conjunto de datos vasto y variado que abarca múltiples géneros y lenguas, Harvard busca garantizar que los sistemas de IA sirvan mejor a poblaciones minoritarias y contextos culturales, promoviendo la equidad y la inclusión en el desarrollo tecnológico. El proyecto subraya la importancia de los datos abiertos de alta calidad y bien estructurados como base fundamental para una innovación ética en el ámbito de la IA. Iniciativas previas exitosas, como el Caselaw Access Project, demuestran cómo la organización de registros históricos legales puede mejorar significativamente las capacidades de aprendizaje automático. Este nuevo esfuerzo, financiado por importantes empresas tecnológicas, refuerza la necesidad de conjuntos de datos accesibles y exhaustivos para evitar que la IA perpetúe los sesgos sociales y para fomentar sistemas inteligentes más robustos y representativos en diversos campos. Este desarrollo es altamente relevante para el movimiento de datos abiertos, ya que ejemplifica cómo las bibliotecas institucionales pueden aprovechar los recursos digitalizados para resolver desafíos técnicos globales. Fomenta un modelo en el que gobiernos y organizaciones, como la próxima plataforma IndiaAI de la India, también prioricen ecosistemas de datos transparentes y de acceso público. Este enfoque democratiza el acceso a los materiales de entrenamiento, permitiendo que desarrolladores de todo el mundo construyan herramientas de IA más justas sin depender exclusivamente de los silos de datos propietarios de las corporaciones.
Fuente: medianama.comPublicado el 2024-12-17
Noticias relacionadas
- US writers guild urges studios to take action over AI copyright “theft”
- Kenya Open data Should be Presented and Marketed as Open for all - KachTech Media
- OpenAI Says It’s “Devastated” That a Whistleblower Against It Has Been Found Dead
- The case for open data access to aid tech regulation
- Imaging Firm Shares Patient Scans with AI Company