GPT-4o’s Chinese token-training data is polluted by spam and porn websites
La introducción de tokenizadores avanzados impacta significativamente la eficiencia y la economía de los modelos de lenguaje grandes multilingües. Al optimizar las longitudes de los tokens para idiomas no ingleses como el hindi, el bengalí, el ruso y el árabe, los sistemas pueden procesar las indicaciones más rápidamente y reducir los costos operativos casi en un factor de cuatro. Este cambio destaca una implicación crucial para la accesibilidad global, demostrando que las mejoras técnicas pueden hacer que los servicios de inteligencia artificial de alta calidad sean más asequibles y viables para diversas comunidades lingüísticas, ampliando así el alcance práctico de las tecnologías de IA abierta más allá del desarrollo centrado en el inglés. Sin embargo, este progreso está distribuido de manera desigual, revelando disparidades críticas en la calidad de los datos. Aunque el modelo maneja eficazmente varios idiomas con pocos recursos, los tokens en chino muestran una contaminación severa, reflejando spam, pornografía y estafas en lugar de estructuras lingüísticas legítimas. Esta inconsistencia subraya una vulnerabilidad importante en la curación de los datos de entrenamiento, donde los esfuerzos insuficientes de limpieza permiten que el contenido malicioso se infiltre en idiomas específicos. Tales defectos corren el riesgo de incrustar sesgos dañinos o imprecisiones en el conocimiento fundamental del modelo, desafiando la integridad de los modelos abiertos que dependen de vastas recopilaciones no curadas de la web. Este artículo es vital para la comunidad de datos abiertos, ya que expone los costos ocultos y los riesgos éticos de depender de datos web sin procesar. Enfatiza que los datos abiertos no son inherentemente limpios ni neutrales; sin estándares rigurosos de transparencia y limpieza, los conjuntos de datos pueden heredar y amplificar los daños sociales. Para los desarrolladores e investigadores que abogan por una IA abierta, esto sirve como un recordatorio contundente de que la procedencia de los datos y el control de calidad no son complementos opcionales, sino requisitos esenciales para construir infraestructuras de IA pública confiables, equitativas y seguras.
Source: technologyreview.comPublished on 2024-07-08
Related news
- Google claims new AI training tech is 13 times faster and 10 times more power efficient — DeepMind's new JEST optimizes training data for impressive gains
- Projects funded under national AI programme AISG focus on good training datasets
- Revealed: Durham modules ranked by student attainment in 2021-2022
- Council paid out tens of thousands of pounds due to data breaches
- El I Foro Urbano de la Región conoce los 100 proyectos que conforman la Estrategia Murcia 2030 del Ayuntamiento