The easy case: benchmark + evaluator
Benchmark
curated task
Agent
runs task
Evaluator
scores output
PASS / FAIL / REWARD
+ Feedback
AI text/layout recreation from video frame; verify against source image.