Leaderboard

MLS-Bench-Lite Score. The evaluation is based on Harbor with a 5-hour exploration budget for each agent.

MLS-Bench Lite
Human SOTA
#ModelHarnessPerformance
1AnthropicClaude Fable 5ClosedClaude Codemax(with fallback)49.9
2MoonshotKimi K3OpenKimi-Codemax48.3
3OpenAIGPT 5.6 SolClosedCodexmax46.2
4AnthropicClaude Opus 4.8ClosedClaude Codemax42.8
5OpenAIGPT 5.6 TerraClosedCodexmax40.8
6OpenAIGPT 5.6 SolClosedCodexxhigh40.4
7ZhipuGLM 5.2OpenClaude Codemax40.4
8OpenAIGPT 5.6 LunaClosedCodexmax39.1
9OpenAIGPT-5.5ClosedCodexxhigh35.5
10MoonshotKimi K2.7 CodeOpenKimi-Code35.1
11OpenAIGPT 5.6 LunaClosedCodexxhigh34.5
12OpenAIGPT 5.6 TerraClosedCodexxhigh33.6
13AnthropicClaude Sonnet 5ClosedClaude Codemax31.1
14MoonshotKimi K2.6OpenKimi-Code26.7
15DeepSeekDeepSeek V4 ProOpenClaude Code24.4