Sample data
Observe

Runs & Analytics

Compare model snapshots on frozen environments and inspect the trajectories behind every result.

ACTIVE EXPERIMENTAgent reliability · checkpoint comparison
Complete
Best pass@1
74.2%Orion-3.1 · +8.4 pts
Reproducibility
99.8%2 inconsistent of 1,248 runs
Median episode
04:38p90 · 09:12
Cost / success
$0.71−12% vs. prior checkpoint

Model comparison

Pass@1 across 24 frozen environments

1007550250
74%
Orion-3.1
61%
Nova-Reasoner
48%
Atlas-Coder-70B
29%
Open baseline

Capability matrix

Success rate by model and capability

OrionNovaAtlasBaseline
Code repair82%68%56%34%
Reasoning71%77%43%28%
Tool use69%52%45%24%
Robustness76%49%51%31%
LowerHigher
TOP FAILURE CLUSTERIncomplete state recovery

18 episodes · mostly concurrent code tasks

LARGEST REGRESSIONLong-horizon tool use

−9.2 pts vs. Orion-3.0

LARGEST GAINAdversarial parsing

+14.8 pts vs. prior checkpoint

Recent episodes

Exact model, environment revision, prompt, and result for every run

RunModel snapshotEnvironmentResultRewardDurationCostStarted
run_10842Orion-3.1Atomic cache recoveryPassed1.0004:18$0.424 min ago
run_10841Atlas-Coder-70BAtomic cache recoveryFailed0.0006:00$0.3112 min ago
run_10840Orion-3.1Incident triage deskPassed0.9208:47$0.8821 min ago
run_10839Nova-ReasonerBounded permutation orbitsFailed0.0002:11$0.1934 min ago
run_10838Atlas-Coder-70BStreaming ledger parserPassed1.0005:26$0.3751 min ago