Quick Codexometer Bench run, ranking with bias towards lower cost (actually, prioritising for speed doesn’t change the ranking!)
| RANK | MODEL | EFFORT | TASK | RESULT | TIME | TOKENS | API EQ |
|---|---|---|---|---|---|---|---|
| #1 | GPT-6-Luna | HIGH | DEPENDENCY SCHEDULER | PASS | 27.4s | 15.4K | ~$0.0023 |
| #1 | GPT-6-Luna | HIGH | VERSION RESOLVER | PASS | 16.5s | 14.7K | ~$0.0019 |
| #1 | GPT-6-Luna | HIGH | EVENT PROCESSOR | PASS | 14.5s | 14.6K | ~$0.0018 |
| #2 | GPT-6-Sol | HIGH | DEPENDENCY SCHEDULER | PASS | 41.7s | 16.6K | ~$0.0575 |
| #2 | GPT-6-Sol | HIGH | VERSION RESOLVER | PASS | 15.8s | 14.8K | ~$0.0184 |
| #2 | GPT-6-Sol | HIGH | EVENT PROCESSOR | PASS | 17.5s | 15.1K | ~$0.0204 |
| #3 | GPT-5.6-Sol | HIGH | DEPENDENCY SCHEDULER | PASS | 1m08s | 17.1K | ~$0.1307 |
| #3 | GPT-5.6-Sol | HIGH | VERSION RESOLVER | PASS | 11.7s | 14K | ~$0.0294 |
| #3 | GPT-5.6-Sol | HIGH | EVENT PROCESSOR | PASS | 15.7s | 14.5K | ~$0.0363 |
| #4 | GPT-5.6-Luna | HIGH | DEPENDENCY SCHEDULER | FAIL | 1m16s | 17.8K | ~$0.0097 |
| #4 | GPT-5.6-Luna | HIGH | VERSION RESOLVER | PASS | 22.2s | 13.4K | ~$0.0043 |
| #4 | GPT-5.6-Luna | HIGH | EVENT PROCESSOR | PASS | 34.9s | 14.6K | ~$0.0037 |
Looks like a win guys!
(but mainly because of that 50% reduction, though it appears GPT-6-Sol can be faster too)
(NB I reran the failed result for 5.6 Luna and it … failed again, so I’ve let that stand - looks like 6 Luna is a “better” model too)