grpo_demo.py
GRPO self-correction on Llama-1B :)
train/rewards/accuracy
train/completion_length
script:
AI text/layout recreation from video frame; verify against source image.