Spawning wants to build more ethical AI training datasets | TechCrunch

Spawning AI ha lanzado Source.Plus, una plataforma curada diseñada para ofrecer a los artistas mayor control y una compensación justa por su trabajo en el entrenamiento de la IA generativa. Al centrarse en un conjunto de datos de alta calidad compuesto por imágenes de dominio público y con licencia CC0, el proyecto pretende proporcionar una alternativa fiable a los métodos de raspado (scraping) poco regulados que suelen emplear los principales desarrolladores de IA. Esta iniciativa aborda la necesidad crítica de una obtención ética de datos, permitiendo que los creadores opten por participar bajo sus propias condiciones, mientras asegura que los desarrolladores puedan acceder a materiales utilizables sin ambigüedades legales. La plataforma se distingue mediante rigurosos procesos de validación, excluyendo contenido con licencias cuestionables y empleando clasificadores y moderadores para filtrar material dañino o no consensuado. A diferencia de los modelos existentes, que a menudo se basan en métricas opacas o pagos mínimos, Source.Plus empodera a los titulares de los derechos para fijar sus propios precios por el uso de los datos. Spawning cobra únicamente una tarifa plana nominal, lo que garantiza que la mayor parte de los ingresos vaya directamente a los contribuyentes, estableciendo así un marco financiero más transparente y equitativo para los profesionales creativos. Este enfoque es altamente relevante para el ámbito de los datos abiertos, ya que desafía la narrativa predominante de que los datos abiertos deben ser gratuitos y sin restricciones para ser útiles. Source.Plus demuestra que los conjuntos de datos abiertos y de alta integridad pueden coexistir con una gestión robusta de los derechos y la compensación a los artistas. Ofrece un modelo potencial para ecosistemas abiertos sostenibles, donde la disponibilidad de datos no implique la explotación de los creadores, proporcionando una vía viable para integrar estándares éticos en la comunidad más amplia de datos abiertos y desarrollo de IA.

Source: techcrunch.com
Published on 2024-06-12