OpenCodePapers

code-generation-on-terminal-bench-2-1

Code Generation
Dataset Link
Results over time
Click legend items to toggle metrics. Hover points for model names.
Leaderboard
PaperCodeAccuracyModelNameReleaseDate
GPT-5.6: Frontier intelligence that scales with your ambition91.9GPT-5.6 Sol Ultra2026-07-09
Kimi K3 Tech Blog: Open Frontier Intelligence88.3KimiCode + Kimi K3 Max2026-07-17
Claude Fable 5 and Claude Mythos 588.0mini-SWE-agent + Claude Mythos 52026-06-09
Introducing GPT-5.584.0Terminus-2 + GPT-5.52026-04-23
Fable 583.8Claude Code + Fable 52026-06-07
Introducing Grok 4.583.3Grok 4.52026-07-08
GPT-5.583.1Codex + GPT-5.52026-05-01
GLM-5.2: Built for Long-Horizon Tasks✓ Link82.7Claude Code + GLM-5.22026-06-16
Fable 580.4Terminus 2 + Fable 52026-06-05
Introducing Muse Spark 1.180.0bash-tool-only agent harness + Muse Spark 1.12026-07-09
Grok 4.579.3Cursor CLI + Grok 4.52026-07-09
Opus 4.878.9Claude Code + Opus 4.82026-07-09
GPT-5.6 Terra78.4Codex + GPT-5.6 Terra2026-07-11
Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding✓ Link78.2Claude Code + Ornith-1.0-397B2026-06-21
GPT-5.578.0Terminus 2 + GPT-5.52026-05-01
Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding✓ Link77.5Terminus-2 + Ornith-1.0-397B2026-06-21
Muse Spark 1.176.2mini-SWE-agent + Muse Spark 1.12026-07-09
GPT-5.6 Luna75.7Codex + GPT-5.6 Luna2026-07-11
Introducing Claude Opus 4.874.6Terminus-2 + Claude Opus 4.82026-05-28
Sonnet 574.6Claude Code + Sonnet 52026-07-09
Gemini 3.1 Pro: A smarter model for your most complex tasks74.0Terminus-2 + Gemini 3.1 Pro2026-02-19
Gemini 3 Pro73.9Terminus 2 + Gemini 3 Pro2026-05-01
Hy3✓ Link71.7Hy32026-07-02
Seed2.1 Model Card: Agentic Intelligence for Productivity71.0Seed2.1 Pro2026-06-23
Introducing LongCat-2.0✓ Link70.8LongCat-2.02026-07-05
Opus 4.768.9Claude Code + Opus 4.72026-05-01
Opus 4.766.1Terminus 2 + Opus 4.72026-05-01
Gemini 3 Pro65.8Gemini CLI + Gemini 3 Pro2026-05-01
Gemini 3.1 Pro65.8Gemini CLI + Gemini 3.1 Pro2026-05-05
Gemini 3.1 Pro65.6Terminus 2 + Gemini 3.1 Pro2026-05-05
Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding✓ Link64.2Terminus-2 + Ornith-1.0-35B2026-06-21
Inkling: Our open-weights model✓ Link63.8internal coding harness + Inkling2026-07-15
GLM-5.1: Towards Long-Horizon Tasks✓ Link63.5Terminus-2 + GLM-5.12026-04-03
Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding✓ Link62.8Claude Code + Ornith-1.0-35B2026-06-21
GLM-5.1✓ Link58.7Claude Code + GLM-5.12026-05-01
Nemotron 3 Ultra: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning✓ Link56.4Terminus-2 + Nemotron 3 Ultra2026-06-03
Tmax: A simple recipe for terminal agents✓ Link44.9Vanillux2Agent + Tmax 27B2026-06-22
Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding✓ Link43.1Terminus-2 + Ornith-1.0-9B2026-06-21
Ornith-1.0: Self-Scaffolding LLMs for Agentic Coding✓ Link40.6Claude Code + Ornith-1.0-9B2026-06-21