In Cringe Video, OpenAI CTO Says She Doesn't Know Where Sora's Training Data Came From; "I'm actually not sure about that."

In Cringe Video, OpenAI CTO Says She Doesn't Know Where Sora's Training Data Came From; "I'm actually not sure about that."

La directora de tecnología de OpenAI, Mira Murati, se enfrentó a un intenso escrutinio público por su incapacidad para especificar las fuentes exactas utilizadas para entrenar Sora, el nuevo modelo de generación de video a partir de texto de OpenAI. Durante una entrevista de gran repercusión, Murati ofreció solo vagas garantías de que los datos eran «de acceso público» o «con licencia», admitiendo que no podía confirmar si plataformas específicas como YouTube o Instagram estaban incluidas. Esta falta de transparencia ha sido ampliamente interpretada como una evasión corporativa o como una genuina laguna en el conocimiento interno, exacerbando las controversias existentes en torno a las prácticas de adquisición de datos de OpenAI y las demandas por derechos de autor en curso. El incidente pone de manifiesto una desconexión crítica entre los desarrolladores de inteligencia artificial y el origen de los datos que alimentan sus modelos. Para los defensores de los datos abiertos, esta situación subraya la urgente necesidad de una trazabilidad rigurosa y de transparencia en los datos utilizados en el aprendizaje automático. Si los líderes de una importante empresa de IA no pueden precisar la composición concreta de sus conjuntos de datos de entrenamiento, resulta imposible verificar el cumplimiento de las directrices éticas, las leyes de derechos de autor o las normas de licencias de datos abiertos. Esta opacidad socava la confianza y complica los esfuerzos por establecer marcos claros para el uso responsable de los datos en la inteligencia artificial. En consecuencia, el artículo demuestra por qué la rendición de cuentas es esencial para el movimiento de los datos abiertos. El lenguaje corporativo vago ya no es suficiente cuando se trata de los vastos y no estructurados datos de Internet que alimentan la IA generativa. La controversia sirve como advertencia de que, sin una documentación precisa de las fuentes de datos, las empresas de IA corren el riesgo de enfrentar nuevos desafíos legales y una reacción pública negativa. Asegurar que los datos de entrenamiento estén debidamente obtenidos y licenciados no es solo un requisito legal, sino una expectativa fundamental de transparencia en el ecosistema de los datos abiertos.

Fuente: freerepublic.com
Publicado el 2024-03-18