GitHub - google-deepmind/recurrentgemma: Open weights language model from Google DeepMind, based on Griffin.
RecurrentGemma presenta una arquitectura novedosa que acelera significativamente la inferencia en secuencias largas. Al sustituir la atención global por un enfoque híbrido que combina atención local y recurrencias lineales, el modelo logra ganancias de eficiencia cruciales para el procesamiento escalable del lenguaje. Este cambio arquitectónico representa un avance clave para hacer que los modelos de lenguaje grandes sean más accesibles y eficientes, ofreciendo una alternativa viable a los diseños tradicionales basados en Transformers para ventanas de contexto extendidas. El proyecto se publica con pesos abiertos, proporcionando a investigadores y desarrolladores total transparencia y acceso a los parámetros del modelo. Disponible tanto en implementaciones optimizadas de Flax como en la referencia de PyTorch, soporta diversos entornos de hardware, incluyendo CPUs, GPUs y TPUs. Esta disponibilidad abierta permite la verificación independiente, la personalización y la integración en flujos de trabajo existentes, fomentando un ecosistema colaborativo donde la comunidad puede construir sobre y refinar la tecnología subyacente sin restricciones propietarias. Esta publicación es altamente relevante para los principios de datos abiertos, ya que democratiza el acceso a infraestructura de IA de última generación. Al distribuir los pesos del modelo y el código fuente bajo licencias permisivas, reduce las barreras de entrada para la innovación y la educación. El énfasis en prácticas de ingeniería abiertas y reproducibles fomenta la estandarización y la adopción más amplia de arquitecturas de IA eficientes, asegurando que los avances en eficiencia computacional contribuyan a una base de conocimiento compartida y abierta, en lugar de quedar confinados dentro de sistemas cerrados.
Fuente: github.comPublicado el 2024-04-11