Autonomous Science Bench0.1

Evaluating AI on real workflows for autonomous scientific discovery

Run the benchmarkView the tasksContribute a task

Cite Autonomous Science Bench

If you find this work useful, please cite it.

BibTeX
@misc{autonomoussciencebench2026,
  title={Autonomous Science Bench: Evaluating AI for Autonomous Scientific Discovery},
  author={{Autonomous Science Bench Team}},
  year={2026},
  url={https://yibow.me/autonomous-science-bench},
}

Autonomous Science Bench 0.1 Leaderboard / 4 tasks

Tasks in biology, chemistry, materials and semiconductors · 1 trial each

Pilot results
RankModelAgentResolution rateCostAgent time
1GPT-5.6 Terra(max)Codex75%3/4$21.40189 min
2GLM-5.3 Flashmini-SWE-agent50%2/4$6.59369 min
3Qwen3.8 27Bmini-SWE-agent25%1/4$9.76365 min
3Sonnet 5.5(high)Claude Code25%1/4$2.54148 min
5GPT-5.6 Luna(max)Codex0%0/4$3.07251 min
5Haiku 4.5Claude Code0%0/4$1.7524 min
5MiniMax M3mini-SWE-agent0%0/4$9.96226 min

Resolution rate, share of trials that meet the task’s success criteria · Cost and agent time, totals per configuration. Task scores appear on each field’s tab. Ranked by resolution rate; ties share a rank.