How agentic are our agents?
Many agents are pipelines
Winning apps = tight feedback loops (mostly)
Not many agents "do stuff" for 10+ min
Classical RL = optimize agent policy
Winning apps = tight feedback loops (mostly)
Not many agents "do stuff" for 10+ min
Classical RL = optimize agent policy
Pipelines
Agents
Agents