Autonomous Science Bench0.1
Evaluating AI on real workflows for autonomous scientific discovery
Autonomous Science Bench 0.1 Leaderboard / 4 tasks
Tasks in biology, chemistry, materials and semiconductors · 1 trial each
| Rank | Model | Agent | Resolution rate | Cost | Agent time |
|---|---|---|---|---|---|
| 1 | GPT-5.6 Terra(max) | Codex | 75%3/4 | $21.40 | 189 min |
| 2 | GLM-5.3 Flash | mini-SWE-agent | 50%2/4 | $6.59 | 369 min |
| 3 | Qwen3.8 27B | mini-SWE-agent | 25%1/4 | $9.76 | 365 min |
| 3 | Sonnet 5.5(high) | Claude Code | 25%1/4 | $2.54 | 148 min |
| 5 | GPT-5.6 Luna(max) | Codex | 0%0/4 | $3.07 | 251 min |
| 5 | Haiku 4.5 | Claude Code | 0%0/4 | $1.75 | 24 min |
| 5 | MiniMax M3 | mini-SWE-agent | 0%0/4 | $9.96 | 226 min |
Resolution rate, share of trials that meet the task’s success criteria · Cost and agent time, totals per configuration. Task scores appear on each field’s tab. Ranked by resolution rate; ties share a rank.