Working Towards Toxic-Free AI

Working Towards Toxic-Free AI

ToxicChat, un nuevo punto de referencia (benchmark) desarrollado por investigadores de la Universidad de California en San Diego, mejora significativamente la detección de toxicidad oculta en los modelos de lenguaje grandes (LLM). A diferencia de conjuntos de datos anteriores que se basaban en datos de redes sociales, ToxicChat analiza interacciones reales entre usuarios e inteligencia artificial, identificando «prompts» de «jailbreaking» (elusión de restricciones) que utilizan un lenguaje aparentemente inocuo para encubrir intenciones dañinas. Este enfoque resulta mucho más eficaz para evitar que los modelos generen contenido ofensivo o estereotipado, en comparación con las herramientas de moderación existentes. La eficacia del benchmark radica en su capacidad para detectar manipulaciones sutiles que los filtros de seguridad actuales suelen pasar por alto. Al entrenar los modelos con estos ejemplos matizados, los desarrolladores pueden crear chatbots más fiables y seguros para su uso general. La investigación destaca que incluso los modelos más potentes requieren salvaguardas robustas contra los usuarios que intentan eludir las directrices éticas mediante formulaciones ingeniosas, garantizando que la inteligencia artificial se mantenga dentro de los límites establecidos por las políticas. Este trabajo es altamente relevante para la comunidad de open_data, ya que ToxicChat está disponible públicamente en Hugging Face y ya ha sido adoptado por importantes empresas tecnológicas, como Meta, para evaluar sus modelos de salvaguarda. Como benchmark de código abierto, proporciona a la comunidad datos críticos del mundo real para comprender y mitigar los riesgos ocultos en las interacciones con la IA. Su amplio uso y accesibilidad establecen un nuevo estándar de transparencia y seguridad en el desarrollo de modelos de lenguaje grandes confiables.

Fuente: newswise.com
Publicado el 2024-03-05