Lessons from DeepSeek
1 month ago: DeepSeek R1 paper + model
RL on strong base models works
RL with sparse rewards works
o1-level performance = easier than expected
Open-source is back (for now)
So... what next?
RL on strong base models works
RL with sparse rewards works
o1-level performance = easier than expected
Open-source is back (for now)
So... what next?
DeepSeek-R1-Zero AIME accuracy during training
DeepSeek-R1-Zero average length per response during training