Deepseek R1 Zero learns to reason using reinforcement learning on base model [pdf](github.com)6 points by virde 1 year ago | 0 comments