Leaderboard

MLS-Bench-Lite Score. The evaluation is based on Harbor with a 5-hour exploration budget for each agent.

MLS-Bench Lite
Human SOTA
#ModelHarnessPerformance
1QwenQwen3.8-Max-0902OpenClaude Code50.1
2AnthropicClaude Fable 5ClosedClaude Codemax(with fallback)49.9
3AnthropicClaude Opus 5ClosedClaude Codemax49.8
4MoonshotKimi K3OpenKimi-Codemax48.3
5OpenAIGPT 5.6 SolClosedCodexmax46.2
6AnthropicClaude Opus 4.8ClosedClaude Codemax42.8
7QwenQwen3.8-MaxOpenClaude Code41.0
8ZhipuGLM 5.2OpenClaude Codemax40.4
9OpenAIGPT-5.5ClosedCodexxhigh35.5
10MoonshotKimi K2.7 CodeOpenKimi-Code35.1
11QwenQwen3.7-MaxClosedClaude Code31.7
12AnthropicClaude Sonnet 5ClosedClaude Codemax31.4
13MoonshotKimi K2.6OpenKimi-Code26.7
14DeepSeekDeepSeek-V4 Pro PreviewOpenClaude Code24.4