angelX · measured telemetry

Benchmarks

← back to angelX

136 repository-repair tasks (JS, Python, Rust, C++) · 600 s wall cap · evaluator traces, zero self-reporting

Results at a glance · polyglot-v1 · 2026-09-21
Harness DeepSeek V4.1 Flash
thinking off
GLM-5.3-Flash
thinking low
Total
both models
angelX133 / 136135 / 136268 / 272
98.5%
OpenCode 1.18.31132 / 136133 / 136265 / 272
97.4%
oh-my-pi 18.2.453 / 59
budget cap
133 / 136186 / 195
95.4%

The race to 136

Solved attempts vs cumulative agent time

angelXOpenCodeomp

Scoreboard

Every attempt placed at the moment it completed

passedfailed

Output per task

Tokens generated and model calls made per task (cap at 2.5k)

angelXOpenCodeompstacked at 2.5k cap

Seconds per attempt

Wall time per attempt in run order (medians dotted)

■ angelX+ OpenCode× omp

Context burned

Cumulative input tokens: cached vs fresh

angelXOpenCodeomp

Cache hit rate

Share of input tokens served from provider cache

angelXOpenCodeomp

* Graded by task-native test suites on Prime Intellect evaluators (Verifiers v0.3.1) · polyglot-v1: 136 tasks (48 JS, 34 Python, 30 Rust, 24 C++) · 600 s wall cap · 2026-09-21