GPT-4o’s Chinese token-training data is polluted by spam and porn websites

La introducción de tokenizadores avanzados impacta significativamente la eficiencia y la economía de los modelos de lenguaje grandes multilingües. Al optimizar las longitudes de los tokens para idiomas no ingleses como el hindi, el bengalí, el ruso y el árabe, los sistemas pueden procesar las indicaciones más rápidamente y reducir los costos operativos casi en un factor de cuatro. Este cambio destaca una implicación crucial para la accesibilidad global, demostrando que las mejoras técnicas pueden hacer que los servicios de inteligencia artificial de alta calidad sean más asequibles y viables para diversas comunidades lingüísticas, ampliando así el alcance práctico de las tecnologías de IA abierta más allá del desarrollo centrado en el inglés. Sin embargo, este progreso está distribuido de manera desigual, revelando disparidades críticas en la calidad de los datos. Aunque el modelo maneja eficazmente varios idiomas con pocos recursos, los tokens en chino muestran una contaminación severa, reflejando spam, pornografía y estafas en lugar de estructuras lingüísticas legítimas. Esta inconsistencia subraya una vulnerabilidad importante en la curación de los datos de entrenamiento, donde los esfuerzos insuficientes de limpieza permiten que el contenido malicioso se infiltre en idiomas específicos. Tales defectos corren el riesgo de incrustar sesgos dañinos o imprecisiones en el conocimiento fundamental del modelo, desafiando la integridad de los modelos abiertos que dependen de vastas recopilaciones no curadas de la web. Este artículo es vital para la comunidad de datos abiertos, ya que expone los costos ocultos y los riesgos éticos de depender de datos web sin procesar. Enfatiza que los datos abiertos no son inherentemente limpios ni neutrales; sin estándares rigurosos de transparencia y limpieza, los conjuntos de datos pueden heredar y amplificar los daños sociales. Para los desarrolladores e investigadores que abogan por una IA abierta, esto sirve como un recordatorio contundente de que la procedencia de los datos y el control de calidad no son complementos opcionales, sino requisitos esenciales para construir infraestructuras de IA pública confiables, equitativas y seguras.

Source: technologyreview.com
Published on 2024-07-08