GPT-4o’s Chinese token-training data is polluted by spam and porn websites
GPT-4o’s Chinese token-training data is polluted by spam and porn websites
La introducción de un nuevo tokenizador reduce significativamente los costos operativos de los modelos de lenguaje grandes (LLM) en idiomas no ingleses, como el hindi y el bengalí, al permitir un procesamiento más rápido de tokens más largos y contextualmente relevantes. Esta eficiencia permite a los proveedores cobrar menos por salidas idénticas sin necesariamente mejorar drásticamente la calidad lingüística, lo que destaca cómo las mejoras en la infraestructura técnica pueden impactar directamente la accesibilidad y las barreras económicas para los usuarios multilingües. Por otro lado, los datos revelan disparidades severas en la calidad, especialmente con los tokens en chino, que están altamente contaminados por spam, pornografía y contenido relacionado con estafas. Los investigadores señalan que el corpus de entrenamiento carece de esfuerzos adecuados de limpieza para estos idiomas específicos, lo que sugiere que las granjas de contenido y las manipulaciones de los motores de búsqueda han contaminado los datos fundamentales. Este contraste indica que, mientras algunos idiomas se benefician de estructuras web rudimentarias pero limpias, otros sufren una agresiva contaminación digital que no fue filtrada adecuadamente antes del entrenamiento del modelo. Este artículo es altamente relevante para open_data porque subraya la importancia crítica de la higiene de datos y la transparencia en el desarrollo de IA. Demuestra cómo los conjuntos de datos sin curar y contaminados pueden incrustar permanentemente contenido tóxico en los modelos fundamentales, haciendo que las correcciones posteriores sean difíciles. Para la comunidad de datos abiertos, esto sirve como una advertencia de que simplemente acceder o utilizar datos web a gran escala sin protocolos rigurosos de limpieza específicos por idioma corre el riesgo de perpetuar sesgos dañinos y vulnerabilidades de seguridad en las herramientas de IA públicas.
Fuente: technologyreview.comPublicado el 2024-06-01
Noticias relacionadas
- Hugging Face says it detected 'unauthorized access' to its AI model hosting platform | TechCrunch
- Freedom of Information Act
- Clearing Rights For A ‘Non-Infringing’ Collection Of AI Training Media Is Hard
- Inflación en Estados Unidos permanece estable en abril
- Un centro estadístico independiente que concentre todos los datos públicos ayudaría la democracia