Strong Reasoning Through SFT
DeepSeek-V3 Base
DeepSeek-R1-Zero
SFT on
RL Initialization
RL Converged
600k reasoning samples
600k reasoning samples
200k general samples
Reasoning Model
DeepSeek-R1
AI text/layout recreation from video frame; verify against source image.