GPT-4o’s Chinese token-training data is polluted by spam and porn websites

GPT-4o’s Chinese token-training data is polluted by spam and porn websites

La introducción de un nuevo tokenizador reduce significativamente los costos operativos de los modelos de lenguaje grandes (LLM) en idiomas no ingleses, como el hindi y el bengalí, al permitir un procesamiento más rápido de tokens más largos y contextualmente relevantes. Esta eficiencia permite a los proveedores cobrar menos por salidas idénticas sin necesariamente mejorar drásticamente la calidad lingüística, lo que destaca cómo las mejoras en la infraestructura técnica pueden impactar directamente la accesibilidad y las barreras económicas para los usuarios multilingües. Por otro lado, los datos revelan disparidades severas en la calidad, especialmente con los tokens en chino, que están altamente contaminados por spam, pornografía y contenido relacionado con estafas. Los investigadores señalan que el corpus de entrenamiento carece de esfuerzos adecuados de limpieza para estos idiomas específicos, lo que sugiere que las granjas de contenido y las manipulaciones de los motores de búsqueda han contaminado los datos fundamentales. Este contraste indica que, mientras algunos idiomas se benefician de estructuras web rudimentarias pero limpias, otros sufren una agresiva contaminación digital que no fue filtrada adecuadamente antes del entrenamiento del modelo. Este artículo es altamente relevante para open_data porque subraya la importancia crítica de la higiene de datos y la transparencia en el desarrollo de IA. Demuestra cómo los conjuntos de datos sin curar y contaminados pueden incrustar permanentemente contenido tóxico en los modelos fundamentales, haciendo que las correcciones posteriores sean difíciles. Para la comunidad de datos abiertos, esto sirve como una advertencia de que simplemente acceder o utilizar datos web a gran escala sin protocolos rigurosos de limpieza específicos por idioma corre el riesgo de perpetuar sesgos dañinos y vulnerabilidades de seguridad en las herramientas de IA públicas.

Fuente: technologyreview.com
Publicado el 2024-06-01