NewsSeparating signal from noise in coding evaluationsJuly 8, 20261 min readSource: OpenAI NewsA new analysis from OpenAI reveals issues in SWE-Bench Pro, a popular coding benchmark, raising concerns about reliability and accuracy in evaluating AI models.