apple/OpenELM 路 Hugging Face
OpenELM presenta una nueva familia de modelos de lenguaje eficientes que emplean una estrategia de escalado por capas para optimizar la asignación de parámetros dentro de las arquitecturas Transformer. Este enfoque mejora significativamente la precisión del modelo sin aumentar proporcionalmente los costos computacionales, demostrando que una distribución estratégica de los recursos puede conducir a un rendimiento superior en comparación con los métodos de escalado uniforme. El proyecto contribuye al ecosistema de datos abiertos al poner a disposición tanto modelos preentrenados como ajustados mediante instrucciones, en diversos tamaños. Al hacer estos modelos públicamente accesibles junto con los conjuntos de datos de entrenamiento y el código, los autores fomentan la transparencia y la reproducibilidad en la investigación de procesamiento del lenguaje natural, permitiendo a los desarrolladores inspeccionar y construir sobre líneas base establecidas. Este lanzamiento es particularmente relevante para las iniciativas de datos abiertos, ya que proporciona herramientas accesibles y de alta calidad para estudiar el comportamiento y la eficiencia de los modelos de lenguaje. Sin embargo, los autores enfatizan que, aunque los datos y el código son de código abierto, los modelos carecen de garantías inherentes de seguridad, subrayando la necesidad crítica de que los usuarios implementen mecanismos rigurosos de prueba y filtrado para mitigar posibles sesgos o salidas dañinas en entornos aplicados.
Fuente: huggingface.coPublicado el 2024-04-25
Noticias relacionadas
- Apple boasts of accuracy improvements in release of four OpenELMs
- Microsoft launches lightweight AI model - ET CIO
- Snowflake says its new LLM outperforms Meta's Llama 3 on half the training
- Why code-testing startup Nova AI uses open source LLMs more than OpenAI
- Freedom of Information statistics: October to December 2023