Uncensor any LLM with abliteration
Este artículo explora la "abliteración", una técnica para eliminar la censura en modelos de lenguaje grandes (LLMs) ajustados mediante instrucciones, sin necesidad de volver a entrenarlos. Los modelos modernos están entrenados para rechazar solicitudes dañinas mediante direcciones vectoriales específicas en sus flujos residuales. Al identificar esta "dirección de rechazo" a través de la diferencia en las activaciones entre prompts dañinos e inocuos, la abliteración permite que el modelo eluda los filtros de seguridad incorporados. Este método desbloquea eficazmente la IA, permitiendo que responda a todo tipo de prompts, independientemente de la gravedad del contenido. El proceso implica recopilar datos de activación para calcular el vector de rechazo, para luego neutralizarlo ya sea mediante intervenciones durante la inferencia o modificando permanentemente los pesos del modelo. La implementación utiliza la ortogonalización de pesos para evitar que los componentes del modelo proyecten las salidas sobre la dirección de rechazo. Este enfoque garantiza que el modelo conserve sus capacidades fundamentales mientras pierde el mecanismo específico que desencadena los rechazos, ofreciendo una alternativa técnica al ajuste fino tradicional para lograr un comportamiento sin restricciones. Esto es altamente relevante para la comunidad de datos abiertos, ya que demuestra cómo la investigación en interpretabilidad puede influir directamente en el comportamiento del modelo y en los límites de seguridad. Destaca la transparencia de los mecanismos de las redes neuronales, mostrando que las características de seguridad no son inmutables, sino que pueden manipularse matemáticamente. Para investigadores y desarrolladores que trabajan con pesos abiertos, esto subraya la importancia de comprender los componentes internos del modelo para evaluar la confiabilidad, los riesgos de seguridad y el potencial de mal uso cuando se eliminan las barreras de seguridad.
Source: huggingface.coPublished on 2024-06-14
Related news
- Experts Exchange takes a stand against AI-creep by blocking companies from scraping content and data from its community
- Google AI Gemini parrots China’s propaganda
- INAI pide a Sheinbaum un “Plan D”, de diálogo con el organismo | Periódico Zócalo | Noticias de Saltillo, Torreón, Piedras Negras, Monclova, Acuña
- The Fight Against AI Comes to a Foundational Data Set
- New EU AI Regulations Shake Up Tech Industry with Data Disclosure Demands