completed study/60 of 60 valid runs/published with traces

Mini Ledger v4 · long-horizon terminal benchmark

Long tasks change
the ranking.

Four coding harnesses ran the same three models through a continuous 15-turn engineering task. Five independent generations per combination. Nobody solved it perfectly—and the harness mattered.

runs
6012 combos × 5 generations
turns
900same session + workspace
best average
73.44Claude Code × Sol
perfect runs
0best single run 81.82
01 / final leaderboard

A spread, not a saturation test.

Score combines 70 visible stage points with 30 points from 11 private holdout checks. Bars show the five-run range; markers are individual generations.

01Claude Codev2.1.211 × Sol73.4433m
generationscorevisibleholdoutdurationevidence
#181.8260/708/1129mresulttrace ↓
#266.3650/706/1131mresulttrace ↓
#355.3639/706/1147mresulttrace ↓
#481.8260/708/1128mresulttrace ↓
#581.8260/708/1129mresulttrace ↓
02Claude Codev2.1.211 × Luna49.5823m
generationscorevisibleholdoutdurationevidence
#156.3640/706/1123mresulttrace ↓
#255.3639/706/1123mresulttrace ↓
#362.3646/706/1125mresulttrace ↓
#428.9118/704/1120mresulttrace ↓
#544.9134/704/1122mresulttrace ↓
03Codex CLIv0.144.0 × Luna40.7543m
generationscorevisibleholdoutdurationevidence
#166.3650/706/1139mresulttrace ↓
#222.9112/704/1149mresulttrace ↓
#325.9115/704/1144mresulttrace ↓
#463.6450/705/1136mresulttrace ↓
#524.9114/704/1149mresulttrace ↓
04Codex CLIv0.144.0 × Sol36.2245m
generationscorevisibleholdoutdurationevidence
#152.3636/706/1150mresulttrace ↓
#212.0012/700/1151mresulttrace ↓
#36.006/700/1146mresulttrace ↓
#458.3642/706/1141mresulttrace ↓
#552.3636/706/1139mresulttrace ↓
05Codex CLIv0.144.0 × Terra33.7631m
generationscorevisibleholdoutdurationevidence
#141.6428/705/1134mresulttrace ↓
#266.3650/706/1131mresulttrace ↓
#325.9115/704/1131mresulttrace ↓
#43.003/700/1131mresulttrace ↓
#531.9121/704/1128mresulttrace ↓
06Claude Codev2.1.211 × Terra30.0525m
generationscorevisibleholdoutdurationevidence
#122.649/705/1151mresulttrace ↓
#263.3647/706/1116mresulttrace ↓
#335.3619/706/1121mresulttrace ↓
#40.000/700/1118mresulttrace ↓
#528.9118/704/1119mresulttrace ↓
07Piv0.80.7 × Sol27.0041m
generationscorevisibleholdoutdurationevidence
#140.6427/705/1144mresulttrace ↓
#23.003/700/1146mresulttrace ↓
#321.0021/700/1142mresulttrace ↓
#458.3642/706/1138mresulttrace ↓
#512.0012/700/1137mresulttrace ↓
08Piv0.80.7 × Luna27.0038m
generationscorevisibleholdoutdurationevidence
#140.3624/706/1139mresulttrace ↓
#219.919/704/1133mresulttrace ↓
#319.919/704/1134mresulttrace ↓
#425.9115/704/1138mresulttrace ↓
#528.9118/704/1147mresulttrace ↓
09Piv0.80.7 × Terra19.6928m
generationscorevisibleholdoutdurationevidence
#112.0012/700/1128mresulttrace ↓
#216.916/704/1132mresulttrace ↓
#322.9112/704/1124mresulttrace ↓
#425.6412/705/1129mresulttrace ↓
#521.0021/700/1127mresulttrace ↓
10DotAgentsv1.1.6 × Sol18.651h 29m
generationscorevisibleholdoutdurationevidence
#122.9112/704/111h 18mresulttrace ↓
#26.006/700/111h 33mresulttrace ↓
#36.006/700/111h 34mresulttrace ↓
#40.000/700/111h 44mresulttrace ↓
#558.3642/706/111h 16mresulttrace ↓
11DotAgentsv1.1.6 × Terra15.3355m
generationscorevisibleholdoutdurationevidence
#19.009/700/111h 02mresulttrace ↓
#218.0018/700/1146mresulttrace ↓
#340.6427/705/1154mresulttrace ↓
#49.009/700/1158mresulttrace ↓
#50.000/700/1156mresulttrace ↓
12DotAgentsv1.1.6 × Luna14.461h 03m
generationscorevisibleholdoutdurationevidence
#18.736/701/111h 06mresulttrace ↓
#211.739/701/111h 02mresulttrace ↓
#35.733/701/111h 07mresulttrace ↓
#48.736/701/111h 05mresulttrace ↓
#537.3621/706/1158mresulttrace ↓
02 / what we learned

The model name was not the whole condition.

A

Harness × model interaction

Claude Code with Sol led at 73.44. The same model family did not hold the same rank across harnesses, so neither a harness-only nor model-only summary explains the result.

B

Within-combo variance is real

Codex CLI × Terra ranged from 3.00 to 66.36—a 63.36-point swing under the same declared condition.

C

Duration did not buy the win

The fastest average condition was Claude Code × Luna at 23m. Some slower conditions scored lower; runtime is reported as evidence, not interpreted as causal.

D

The ceiling held

The best individual run scored 81.82. Zero runs reached 100, leaving headroom across concurrency, recovery, compaction, validation, and integrated stress behavior.

03 / fairness contract

Same job. Sealed schedule. Every combination.

All 60 jobs were declared before execution. Each run used the same prompt sequence, verifier hashes, high reasoning request, isolated workspace, disabled network, and one continuous harness session. A run only scores when all 15 turns complete and both verifier layers execute.

Claude Code and DotAgents reached the pinned model endpoints through CLIProxyAPI; Codex CLI and Pi used their native routes. That transport difference is part of the published harness condition. Token telemetry is retained but not ranked because harnesses report cache and context usage differently.

turn budget
20 minutes
workspace
50 MB max
public score
70 points
holdout score
30 points
human intervention
invalidates run
network
disabled
04 / evidence release

Don’t trust the chart.
Open the run.

49 MB of downloadable semantic traces preserve all distinct messages, tool calls, results, usage events, and stderr from 25.0 GB of cumulative raw streams.

What “semantic trace” means

Pi and early DotAgents streams repeatedly emitted the entire growing conversation, producing 26.8 GB from 900 turns. The release removes only those cumulative streaming snapshots after retaining their final messages and tool calls. Every source trace is hashed, the transformation is open source, 225 secret-shaped fields or values were redacted, and host paths were normalized.

inspect the exporter ↗
companion chess benchmark/Jul 17, 2026

the battle lane · three models · four harnesses · 11,340 games

Generated agents.
Then battle them.

The original chess lane remains published alongside the terminal study: 12 harness and model combinations, immutable generated engines, and deterministic game replays.

snapshotclaude-code-vs-codex-cli-vs-pi-coding-agent-2026-07-16T19-55-13-136Zresult f2b13c5e1046read the protocol →browse public dataset →
agent harnesses4Codex CLI v0.144.0 · Pi v0.80.7 · Claude Code v2.1.211 · DotAgents v1.1.6
generated engines605 per model, per harness
cross-harness games8,64012 harness × model entrants
generation tokens4,042,497346 tool calls · 0 MCP
Exploratory harness suite

All 60 engines used the same prompt and requested high reasoning. The leaderboard compares same-model games across 4 harnesses — Codex CLI v0.144.0 · Pi v0.80.7 · Claude Code v2.1.211 · DotAgents v1.1.6 — and shows each combo’s schedule size; independent Harbor reproduction is not claimed.

primary leaderboard · 12 benchmark entrants

Harness × model leaderboard

controlled same-model score · 660 / 180 games by schedule

Each row is one harness and model combination, pooling its 5 independently generated engines. Scores use same-model cross-harness games so model identity stays fixed; the dots keep generation variance visible. How pooled score works →

01
Pi v0.80.7GPT-5.6 Lunagpt-5.6-luna
56.21%371 / 660 pts
median 53.03% · range 49.62%65.53%
875685W–D–L
02
DotAgents v1.1.6GPT-5.6 Solgpt-5.6-sol
54.72%98.5 / 180 pts
median 58.33% · range 38.89%63.89%
3911922W–D–L
03
Claude Code v2.1.211GPT-5.6 Solgpt-5.6-sol
54.17%357.5 / 660 pts
median 58.33% · range 41.29%61.36%
14043585W–D–L
04
DotAgents v1.1.6GPT-5.6 Terragpt-5.6-terra
51.11%92 / 180 pts
median 50% · range 48.61%54.17%
81684W–D–L
05
Pi v0.80.7GPT-5.6 Terragpt-5.6-terra
50.45%333 / 660 pts
median 49.62% · range 49.24%54.55%
136407W–D–L
06
Codex CLI v0.144.0GPT-5.6 Terragpt-5.6-terra
50%330 / 660 pts
median 50% · range 49.24%50.76%
1064010W–D–L
07
Pi v0.80.7GPT-5.6 Solgpt-5.6-sol
49.32%325.5 / 660 pts
median 49.62% · range 39.39%59.47%
7051179W–D–L
08
Claude Code v2.1.211GPT-5.6 Terragpt-5.6-terra
49.24%325 / 660 pts
median 48.86% · range 48.11%51.52%
564015W–D–L
09
Codex CLI v0.144.0GPT-5.6 Lunagpt-5.6-luna
48.03%317 / 660 pts
median 46.59% · range 46.59%53.03%
1560441W–D–L
10
DotAgents v1.1.6GPT-5.6 Lunagpt-5.6-luna
46.94%84.5 / 180 pts
median 47.22% · range 43.06%50%
116712W–D–L
11
Claude Code v2.1.211GPT-5.6 Lunagpt-5.6-luna
46.59%307.5 / 660 pts
median 46.97% · range 44.7%48.86%
560550W–D–L
12
Codex CLI v0.144.0GPT-5.6 Solgpt-5.6-sol
45.23%298.5 / 660 pts
median 47.35% · range 37.88%50.38%
43511106W–D–L
Pooled score ranks all entrants; DotAgents uses targeted placement while established combinations also retain their immutable same-model games. method →Each dot opens one generated engine dossier.
artifact drill-down

All 45 full-league generated engines

individual engine Elo · provisional
01Claude Code v2.1.211Claude Code / GPT-5.6 Sol #2gpt-5.6-solPublished replay bundle19316341715360 games02Pi v0.80.7Pi / GPT-5.6 Sol #2gpt-5.6-solExploratory local18516871708360 games03Claude Code v2.1.211Claude Code / GPT-5.6 Sol #4gpt-5.6-solPublished replay bundle18517321702360 games04Pi v0.80.7Pi / GPT-5.6 Sol #4gpt-5.6-solExploratory local13221991630360 games05Pi v0.80.7Pi / GPT-5.6 Sol #3gpt-5.6-solExploratory local118228141592360 games06Codex CLI v0.144.0GPT-5.6 Sol #5gpt-5.6-solExploratory local88258141580360 games07Claude Code v2.1.211Claude Code / GPT-5.6 Sol #5gpt-5.6-solPublished replay bundle11124541572360 games08Codex CLI v0.144.0GPT-5.6 Sol #4gpt-5.6-solExploratory local87259141567360 games09Codex CLI v0.144.0GPT-5.6 Sol #2gpt-5.6-solExploratory local87257161562360 games10Claude Code v2.1.211Claude Code / GPT-5.6 Sol #1gpt-5.6-solPublished replay bundle81269101557360 games11Codex CLI v0.144.0GPT-5.6 Sol #1gpt-5.6-solExploratory local88249231555360 games12Claude Code v2.1.211Claude Code / GPT-5.6 Sol #3gpt-5.6-solPublished replay bundle1311201091553360 games13Pi v0.80.7Pi / GPT-5.6 Luna #1gpt-5.6-lunaExploratory local81252271541360 games14Pi v0.80.7Pi / GPT-5.6 Luna #2gpt-5.6-lunaExploratory local64275211532360 games15Pi v0.80.7Pi / GPT-5.6 Sol #1gpt-5.6-solExploratory local53294131522360 games16Pi v0.80.7Pi / GPT-5.6 Terra #5gpt-5.6-terraExploratory local25310251487360 games17Pi v0.80.7Pi / GPT-5.6 Luna #3gpt-5.6-lunaExploratory local24302341485360 games18Codex CLI v0.144.0GPT-5.6 Luna #4gpt-5.6-lunaExploratory local32280481480360 games19Pi v0.80.7Pi / GPT-5.6 Sol #5gpt-5.6-solExploratory local12317311479360 games20Claude Code v2.1.211Claude Code / GPT-5.6 Terra #4gpt-5.6-terraPublished replay bundle11308411475360 games21Codex CLI v0.144.0GPT-5.6 Terra #2gpt-5.6-terraExploratory local6310441469360 games22Pi v0.80.7Pi / GPT-5.6 Luna #4gpt-5.6-lunaExploratory local7315381463360 games23Codex CLI v0.144.0GPT-5.6 Terra #5gpt-5.6-terraExploratory local7302511463360 games24Codex CLI v0.144.0GPT-5.6 Terra #3gpt-5.6-terraExploratory local8299531458360 games25Claude Code v2.1.211Claude Code / GPT-5.6 Terra #1gpt-5.6-terraPublished replay bundle2302561457360 games26Claude Code v2.1.211Claude Code / GPT-5.6 Terra #2gpt-5.6-terraPublished replay bundle3296611456360 games27Claude Code v2.1.211Claude Code / GPT-5.6 Luna #4gpt-5.6-lunaPublished replay bundle7316371455360 games28Claude Code v2.1.211Claude Code / GPT-5.6 Luna #1gpt-5.6-lunaPublished replay bundle2305531455360 games29Codex CLI v0.144.0GPT-5.6 Sol #3gpt-5.6-solExploratory local20267731455360 games30Claude Code v2.1.211Claude Code / GPT-5.6 Luna #2gpt-5.6-lunaPublished replay bundle2298601453360 games31Pi v0.80.7Pi / GPT-5.6 Terra #4gpt-5.6-terraExploratory local6303511450360 games32Claude Code v2.1.211Claude Code / GPT-5.6 Terra #3gpt-5.6-terraPublished replay bundle2302561450360 games33Pi v0.80.7Pi / GPT-5.6 Luna #5gpt-5.6-lunaExploratory local7297561448360 games34Claude Code v2.1.211Claude Code / GPT-5.6 Luna #3gpt-5.6-lunaPublished replay bundle2304541447360 games35Claude Code v2.1.211Claude Code / GPT-5.6 Luna #5gpt-5.6-lunaPublished replay bundle2299591446360 games36Claude Code v2.1.211Claude Code / GPT-5.6 Terra #5gpt-5.6-terraPublished replay bundle2305531445360 games37Codex CLI v0.144.0GPT-5.6 Luna #3gpt-5.6-lunaExploratory local4286701445360 games38Codex CLI v0.144.0GPT-5.6 Terra #1gpt-5.6-terraExploratory local5288671443360 games39Codex CLI v0.144.0GPT-5.6 Luna #1gpt-5.6-lunaExploratory local4290661442360 games40Codex CLI v0.144.0GPT-5.6 Luna #2gpt-5.6-lunaExploratory local4290661440360 games41Codex CLI v0.144.0GPT-5.6 Terra #4gpt-5.6-terraExploratory local4288681439360 games42Pi v0.80.7Pi / GPT-5.6 Terra #1gpt-5.6-terraExploratory local5297581434360 games43Pi v0.80.7Pi / GPT-5.6 Terra #2gpt-5.6-terraExploratory local4298581432360 games44Pi v0.80.7Pi / GPT-5.6 Terra #3gpt-5.6-terraExploratory local5288671432360 games45Codex CLI v0.144.0GPT-5.6 Luna #5gpt-5.6-lunaExploratory local3287701431360 games
featured replay

A result should be
more than a row.

Open the complete move log, step through every board state, and inspect both competing artifacts.

watch this battle
initial-positionseed 101
whiteDotAgents / GPT-5.6 Sol #1
vs
blackClaude Code / GPT-5.6 Sol #1
White woncheckmate · 71 plies
evidence chain

From prompt to public result

  1. 01Generate

    Isolated Codex CLI v0.144.0 · Pi v0.80.7 · Claude Code v2.1.211 · DotAgents v1.1.6 harnesses each write executable chess agents.

  2. 02Probe

    Known positions catch malformed output before competition.

  3. 03Battle

    Deterministic positions, colors, seeds, and move limits are recorded.

  4. 04Publish

    Source hashes, telemetry, standings, and replay traces travel together.