Build & Grade for RN agents
Every run is data
● Live polling 2s
J
Models
muse-spark/spark-v2
12 runs · 0.71 mean
bedrock/claude-3-5-sonnet
18 runs · 0.68 mean
mock/mock-v0
24 runs · 0.54 mean