SWE-bench Verified
This profile is built automatically from TLDRocket coverage.
Specifications
No specifications recorded yet.
Latest developments
A primer on self-improving agent harnesses
TLDR Dev · 2 weeks ago ·
3
CoderForge-Preview: SOTA open dataset for training efficient coding agents
Together AI · 5 months ago ·
1
Why we no longer evaluate SWE-bench Verified
OpenAI Blog · 5 months ago ·
26
Introducing SWE-bench Verified
OpenAI Blog · 1 year ago ·
50
2026
Development of autonomous agent harness frameworks for improving large language model reliability and performance Feature update
- A primer on self-improving agent harnesses
- CoderForge-Preview: SOTA open dataset for training efficient coding agents
- Why we no longer evaluate SWE-bench Verified