GPT-4o’s Chinese token-training data is polluted by spam and porn websites
El nuevo tokenizador reduce significativamente los costos operativos para idiomas no ingleses como el hindi y el bengalí, al permitir un procesamiento más rápido y una tokenización más breve. Esta mejora en la eficiencia beneficia a los usuarios de datos abiertos al hacer que los modelos de lenguaje grandes multilingües sean más accesibles y asequibles, lo que permite una inclusión más amplia de conjuntos de datos lingüísticos diversos sin incurrir en gastos computacionales prohibitivos. La calidad de estos tokens refleja en gran medida el contenido estándar de las noticias, lo que indica que los datos de entrenamiento subyacentes para estos idiomas son relativamente limpios y útiles. Por el contrario, la situación es muy diferente en el caso del chino, donde el tokenizador incorpora cantidades considerables de contenido relacionado con spam, pornografía y estafas. Los investigadores señalan que el corpus de entrenamiento carece de una limpieza suficiente, lo que da como resultado tokens fuertemente contaminados por contenido secuestrado y tácticas de manipulación de los motores de búsqueda. Esto revela vulnerabilidades críticas en la forma en que se curan los datos multilingües, mostrando que los métodos de recopilación automatizada a menudo no logran filtrar de manera efectiva la información maliciosa o irrelevante en todos los idiomas. Esta disparidad es altamente relevante para los datos abiertos, ya que subraya la necesidad urgente de establecer estándares rigurosos de higiene de datos en los recursos de inteligencia artificial de acceso público. Si los modelos fundamentales integran datos corruptos, los sistemas resultantes perpetúan la desinformación y los sesgos, lo que socava la integridad del conocimiento de código abierto. Para los desarrolladores e investigadores que dependen de datos abiertos, esto sirve como una advertencia para priorizar conjuntos de datos de alta calidad y verificados, e implementar protocolos de limpieza más estrictos, con el fin de garantizar que los modelos de código abierto sigan siendo confiables y fiables para aplicaciones globales y multilingües.
Source: technologyreview.comPublished on 2024-05-18