OpenAI wants to work with organizations to build new AI training data sets | TechCrunch

El artículo destaca el problema crítico del sesgo y la toxicidad en los datos de entrenamiento de la inteligencia artificial, que a menudo reflejan perspectivas centradas en Occidente y contenido dañino. OpenAI ha lanzado una nueva iniciativa para colaborar con instituciones externas con el fin de curar conjuntos de datos más amplios y representativos. Este esfuerzo tiene como objetivo ampliar la comprensión de la IA sobre culturas, idiomas y dominios especializados, abordando las bases defectuosas que actualmente limitan la utilidad y la seguridad de los modelos. Este modelo de asociación busca digitalizar y agregar datos a gran escala que no son fácilmente accesibles en línea, creando tanto conjuntos de datos de código abierto como privados. Al incluir contenido diverso, OpenAI pretende hacer que sus modelos sean más útiles y universalmente aplicables. El enfoque implica trabajar con gobiernos y organizaciones para mejorar las capacidades lingüísticas y el conocimiento específico de cada dominio, lo que sugiere un cambio hacia métodos de recopilación de datos más inclusivos y exhaustivos para el desarrollo futuro de la IA. Esta iniciativa es altamente relevante para los datos abiertos, ya que subraya la urgente necesidad de información diversa, de alta calidad y obtenida de manera ética para entrenar sistemas de IA justos. Sin embargo, el artículo también plantea preocupaciones sobre los motivos comerciales y la falta de compensación para los contribuyentes de datos, reflejando los debates en curso sobre la propiedad intelectual y el consentimiento. Sirve como recordatorio de que, aunque ampliar el acceso a los datos es crucial, garantizar prácticas equitativas y transparencia en las asociaciones de datos sigue siendo un desafío significativo en el panorama de los datos abiertos.

Source: techcrunch.com
Published on 2023-11-10