跳到正文
原文
OpenAI News·· 2026-07-08AI 评分42

OpenAI 分析揭示 SWE-Bench Pro 编码评测基准存在可靠性问题

Separating signal from noise in coding evaluations

AI 导读

OpenAI 新分析指出流行编码基准 SWE-Bench Pro 存在缺陷,引发对其评估 AI 模型时可靠性与准确性的担忧。该发现揭示了当前主流评测工具在衡量模型编程能力时的潜在偏差风险。

来源:OpenAI News · openai.com