Esta investigación demuestra que el ajuste fino disperso (sparse fine-tuning) puede equilibrar eficazmente el tamaño del modelo y la precisión, ofreciendo una alternativa viable a la cuantización tradicional. Al podar el modelo MPT-7B en un 75 % sin pérdida de precisión, el estudio destaca que la dispersión permite una compresión significativa mientras se mantienen niveles de rendimiento comparables a los de las técnicas de reducción de bits. Este enfoque supera los desafíos comunes del ajuste fino, como las caídas de precisión y el sobreajuste, mediante el empleo de métodos especializados de destilación que recuperan con éxito la precisión incluso en niveles altos de dispersión. Las implicaciones en términos de accesibilidad y coste son profundas, ya que los modelos dispersos pueden ejecutarse de manera eficiente en hardware de consumo estándar y económico, como CPUs comerciales. A diferencia de la cuantización, que presenta dificultades a profundidades de bits más bajas, la dispersión permite velocidades de inferencia más rápidas al omitir los cálculos con ceros y reducir los requisitos de ancho de banda de memoria. Esto hace que los modelos de lenguaje grandes sean viables para su despliegue en dispositivos con recursos limitados, como teléfonos móviles y entornos de computación en el borde (edge computing), democratizando así el acceso a herramientas de IA potentes sin necesidad de GPUs especializadas y costosas. Este hallazgo es altamente relevante para open_data, ya que valida el potencial de los modelos de código abierto para ser optimizados con el fin de un uso más amplio y equitativo. Al demostrar que los modelos abiertos pueden comprimirse intensamente para su ejecución local, fomenta que la comunidad aproveche los conjuntos de datos abiertos existentes para realizar ajustes finos en aplicaciones personalizadas. Esto respalda la filosofía de open_data de transparencia y accesibilidad, asegurando que las capacidades de IA de alta calidad no queden reservadas a infraestructuras propietarias, sino que puedan ser adaptadas y ejecutadas por cualquier persona con hardware básico.
Source: huggingface.coPublished on 2023-10-20
Related news
- University of Turku and SiloGen launch consortium to build the world’s largest open LLM
- AI Is Becoming More Powerful—but Also More Secretive
- Universal Music demanda a Anthropic por las letras de canciones generadas por la IA
- Firma Martí Batres convenio de coordinación para implementación de "Denuncia Digital" - Almomento | Noticias, información nacional e internacional
- Meta, Microsoft y Bloomberg, demandados por herramientas de IA