Benchmarks

Frozen baseline (v1) vs V2 (100 tasks). Source: benchmarks/baseline/summary.json (seed 42, 20 datasets) and benchmarks/v2/catalog.json (30 datasets, 11 categories).

Baseline v1 (frozen)
Not yet frozen — run uv run dsa --limit 50 --out benchmarks/baseline
V2 (research)
benchmarks/v2/catalog.json missing
Runner: uv run dsa --catalog benchmarks/v2/catalog.json --datasets benchmarks/v2/datasets --limit 100 --out /tmp/v2-bench