跳到正文
原文
OpenAI News·· 2025-02-18AI 评分42

OpenAI 推出 SWE-Lancer 基准测试

Introducing the SWE-Lancer benchmark

AI 导读

OpenAI 发布 SWE-Lancer 基准测试,旨在评估前沿大语言模型在真实世界自由职业软件工程任务中的表现。该基准核心问题是检验 LLM 能否通过完成此类任务赚取 100 万美元收入。

来源:OpenAI News · openai.com