OpenAI News·· 2026-07-08AI 评分42
OpenAI 分析揭示 SWE-Bench Pro 编码评测基准存在可靠性问题
Separating signal from noise in coding evaluations
AI 导读
OpenAI 新分析指出流行编码基准 SWE-Bench Pro 存在缺陷,引发对其评估 AI 模型时可靠性与准确性的担忧。该发现揭示了当前主流评测工具在衡量模型编程能力时的潜在偏差风险。
来源:OpenAI News · openai.com