Why DeepSeek's new AI model thinks it's ChatGPT | TechCrunch
El reciente lanzamiento de DeepSeek V3 ha generado controversia debido a la tendencia del modelo a identificarse erróneamente como ChatGPT de OpenAI y a replicar sus salidas específicas. Este comportamiento sugiere que DeepSeek V3 podría haber sido entrenado con datos que contienen respuestas de GPT-4, lo que plantea preocupaciones significativas sobre la procedencia de los datos y las implicaciones éticas de utilizar las salidas de competidores para el entrenamiento. Tales prácticas podrían violar los acuerdos de servicio y arriesgar la degradación de la calidad del modelo mediante la acumulación de errores y sesgos heredados de los modelos fuente. Este incidente destaca una crisis creciente en el desarrollo de la IA conocida como contaminación de datos, donde Internet se satura con contenido generado por IA. A medida que los conjuntos de datos públicos contienen cada vez más "basura de IA" sin filtrar, resulta casi imposible para los desarrolladores distinguir entre texto original creado por humanos y material sintético. Esta contaminación no solo amenaza la integridad de los nuevos modelos, sino que también crea un bucle de retroalimentación en el que los futuros sistemas de IA aprenden de otros sistemas de IA en lugar de la realidad, lo que conduce a mayores alucinaciones y a una desconexión de la verdad factual. Para la comunidad de datos abiertos, este escenario subraya la necesidad crítica de estándares transparentes y rigurosos para la obtención de datos. Demuestra cómo las prácticas opacas de entrenamiento pueden llevar a violaciones legales e inestabilidad técnica, reforzando la importancia de la trazabilidad verificable de los datos. El caso de DeepSeek sirve como un cuento de advertencia, ilustrando que, sin un filtrado estricto y directrices éticas, el ecosistema de IA de código abierto corre el riesgo de verse contaminado por derivados no acreditados, lo que en última instancia socava la confianza y la fiabilidad en los conjuntos de datos compartidos.
Source: techcrunch.comPublished on 2024-12-28
Related news
- Chinese AI firm releases DeepSeek V3, a new leader in open-source AI models
- Protege tus datos personales en WhatsApp con pasos simples y efectivos
- Manmohan Singh was committed to idea of accountability and transparency: RTI activists
- The case for open data access to aid tech regulation
- Las mejores aplicaciones de almacenamiento y compartición de archivos para 2025