'Millions' of NYT and NY Daily News stories taken by OpenAI for training data
El núcleo de estas demandas por derechos de autor en curso radica en un desacuerdo fundamental sobre quién debe asumir la responsabilidad de identificar el material protegido por derechos de autor dentro de los masivos conjuntos de datos de entrenamiento de OpenAI. Si bien las editoriales han descubierto millones de sus obras mediante sus propias búsquedas, sostienen que, como la entidad que recopiló los datos, OpenAI debería ser obligada por orden judicial a identificar explícitamente y admitir qué contenido específico se utilizó para entrenar sus modelos. Las editoriales argumentan que esta transparencia es fundamental para establecer el alcance de la infracción, afirmando que la empresa tecnológica está en una posición única para proporcionar esta información, en lugar de obligar a los titulares de derechos a realizar investigaciones exhaustivas y costosas. Este desacuerdo pone de manifiesto las importantes cargas prácticas y financieras que recaen sobre los demandantes durante la fase de descubrimiento de pruebas en litigios relacionados con la inteligencia artificial. Los editores de noticias han dedicado recursos y tiempo considerables a inspeccionar los datos en un entorno controlado, pero informan que el proceso sigue siendo ineficiente, costoso y técnicamente complejo. Al exigir que OpenAI asuma la iniciativa en el catálogo de su propio uso de material protegido por derechos de autor, los demandantes buscan reducir los costos y retrasos desproporcionados asociados con la búsqueda manual a través de cientos de terabytes de texto no estructurado, trasladando la carga logística de vuelta al desarrollador de IA. Este conflicto es altamente relevante para la comunidad de datos abiertos, ya que establece un precedente crítico para la transparencia y la rendición de cuentas en el aprendizaje automático. Desafía la opacidad de los procesos de entrenamiento propietarios y subraya la tensión entre la viabilidad técnica de la inspección de datos a gran escala y la necesidad legal de probar la infracción de derechos de autor. El resultado probablemente influirá en cómo se manejan los futuros conflictos en la intersección entre los derechos de propiedad intelectual y el desarrollo de la IA, potencialmente forzando una mayor apertura respecto a cómo se construyen los modelos y qué datos públicos o protegidos por derechos de autor se consumen sin consentimiento explícito.
Source: pressgazette.co.ukPublished on 2024-11-07