NVIDIA-Backed Reflection Used 10,500x GB300 GPUs And 46.4 Million Sandboxes Per Day For 4 Weeks To Train Beam, A 501B Open-Weight Model That Is Insanely Efficient

NVIDIA-Backed Reflection Used 10,500x GB300 GPUs And 46.4 Million Sandboxes Per Day For 4 Weeks To Train Beam, A 501B Open-Weight Model That Is Insanely Efficient

Los desarrolladores de inteligencia artificial en Occidente están intensificando sus esfuerzos para igualar el dominio de China en modelos de pesos abiertos eficientes, como lo ejemplifica Beam de Reflection. Este modelo de Mezcla de Expertos (MoE) disperso a gran escala demuestra que un número masivo de parámetros no necesariamente implica costos computacionales prohibitivos. Al activar solo una fracción de sus parámetros durante la inferencia, Beam logra un alto rendimiento mientras reduce significativamente los recursos de hardware necesarios para su implementación. La eficiencia del modelo proviene de técnicas arquitectónicas innovadoras que estabilizan el entrenamiento y optimizan el procesamiento de tokens. Métodos como la utilización uniforme de expertos y la normalización avanzada garantizan la estabilidad numérica y previenen la distorsión de la información a medida que los datos fluyen a través de redes profundas. Además, desacoplar los pipelines de rollout y aprendizaje permite actualizaciones asíncronas, acelerando la fase de aprendizaje por refuerzo sin sucumbir a los problemas de latencia típicamente asociados con la sincronización de pesos. Este desarrollo es altamente relevante para open_data, ya que demuestra que los modelos de pesos abiertos de alta calidad pueden competir con los sistemas propietarios al priorizar la eficiencia arquitectónica sobre la escala bruta. Al reducir la barrera de entrada para ejecutar modelos de IA sofisticados, estos avances fomentan una participación más amplia de la comunidad y la experimentación. En última instancia, Beam ilustra que los ecosistemas de código abierto pueden ofrecer alternativas poderosas y rentables a los modelos propietarios cerrados, fomentando un panorama de IA más accesible y transparente.

Fuente: wccftech.com
Publicado el 2026-10-07