OpenAI News Research & Papers · Jul 8, 2026 13:00 imp:50 Separating signal from noise in coding evaluations A new analysis from OpenAI reveals issues in SWE-Bench Pro, a popular coding benchmark, raising concerns about reliability and accuracy in evaluating AI models. Read original at OpenAI News →