deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B · Hugging Face
DeepSeek ha presentado modelos de razonamiento de primera generación que validan el aprendizaje por refuerzo a gran escala como un método viable para desarrollar procesos de pensamiento complejos sin necesidad de un ajuste fino supervisado inicial. Este enfoque permite que los modelos descubran de manera natural comportamientos de razonamiento poderosos, como la autoverificación y la generación de cadenas largas de pensamiento (chain-of-thought). Al combinar este aprendizaje por refuerzo básico con un ajuste fino dirigido, los modelos resultantes alcanzan un rendimiento comparable al de las principales alternativas propietarias en tareas de matemáticas, programación y razonamiento lógico. Un hallazgo crítico de esta investigación es la eficacia de destilar estos patrones de razonamiento avanzados en modelos densos significativamente más pequeños. Estas versiones destiladas mantienen un alto rendimiento en diversas pruebas de evaluación, al tiempo que son mucho más accesibles para su implementación local. Esta democratización de las capacidades de razonamiento de alto nivel significa que los investigadores y desarrolladores pueden ahora utilizar habilidades de resolución de problemas de última generación sin los enormes recursos computacionales requeridos por los modelos fundacionales masivos. Este lanzamiento es altamente relevante para la comunidad de open_data, ya que se open-sourcea completamente tanto los modelos base de razonamiento como las variantes destiladas bajo licencias permisivas. Al proporcionar los datos de razonamiento subyacentes y los pesos de los modelos, DeepSeek permite a la comunidad construir sobre estas capacidades, fomentando la transparencia y acelerando la innovación. Esta contribución apoya un ecosistema más abierto donde las herramientas avanzadas de razonamiento de IA son accesibles para modificación, uso comercial e investigación adicional, en lugar de estar confinadas a APIs cerradas.
Source: huggingface.coPublished on 2025-01-22
Related news
- DeepSeek's new open-source AI model can outperform o1 for a fraction of the cost
- Call of Duty: Black Ops 6 Zombies' Directed Mode Has Already Proven Its Worth
- CPLT ordena investigación sumaria en 3 subsecretarías por grave incumplimiento a Ley de Transparencia
- España, único gran mercado de la UE donde crecieron las ventas de coches en 2024
- Mexicana: exige INAI presentar los contratos de arriendo de aviones | Noticias de turismo REPORTUR