DesktopBench

Leaderboard

Jun 25, 2026 / 200 tasks / 3 models

Ranking agents on economically valuable professional software work, built from real workflows and scored with resettable environments, tasks, and programmatic verifiers.

Rank 1

Opus 4.8

Anthropic · Proprietary

Score
62.0±1.0%
Success / Total
124 / 200 avg
Runs
2
Max Steps
100
Run Success / Total StoreOpsAccountingOpsSupportOpsSalesOpsOfficeOps
Run 1 126 / 200 30 / 4025 / 4028 / 4521 / 3522 / 40
Run 2 122 / 200 29 / 4024 / 4027 / 4520 / 3522 / 40

Rank 2

OpenAI 5.4 mini

OpenAI · Proprietary

Score
58.0±1.0%
Success / Total
116 / 200 avg
Runs
2
Max Steps
100
Run Success / Total StoreOpsAccountingOpsSupportOpsSalesOpsOfficeOps
Run 1 118 / 200 28 / 4023 / 4026 / 4519 / 3522 / 40
Run 2 114 / 200 27 / 4022 / 4025 / 4519 / 3521 / 40

Rank 3

RLVR open-weight model

Open weight · RLVR trained

Score
45.5±1.0%
Success / Total
91 / 200 avg
Runs
2
Max Steps
100
Run Success / Total StoreOpsAccountingOpsSupportOpsSalesOpsOfficeOps
Run 1 93 / 200 23 / 4018 / 4020 / 4515 / 3517 / 40
Run 2 89 / 200 22 / 4017 / 4019 / 4514 / 3517 / 40
Rank Model Provider Runs Score Details
1 Opus 4.8 Proprietary Anthropic 2 62.0±1.0%
Success / Total: 124 / 200 avg Max Steps: 100
Run Success / Total StoreOpsAccountingOpsSupportOpsSalesOpsOfficeOps
Run 1 126 / 200 30 / 4025 / 4028 / 4521 / 3522 / 40
Run 2 122 / 200 29 / 4024 / 4027 / 4520 / 3522 / 40
2 OpenAI 5.4 mini Proprietary OpenAI 2 58.0±1.0%
Success / Total: 116 / 200 avg Max Steps: 100
Run Success / Total StoreOpsAccountingOpsSupportOpsSalesOpsOfficeOps
Run 1 118 / 200 28 / 4023 / 4026 / 4519 / 3522 / 40
Run 2 114 / 200 27 / 4022 / 4025 / 4519 / 3521 / 40
3 RLVR open-weight model RLVR trained Open weight 2 45.5±1.0%
Success / Total: 91 / 200 avg Max Steps: 100
Run Success / Total StoreOpsAccountingOpsSupportOpsSalesOpsOfficeOps
Run 1 93 / 200 23 / 4018 / 4020 / 4515 / 3517 / 40
Run 2 89 / 200 22 / 4017 / 4019 / 4514 / 3517 / 40