跳到正文
原文
OpenAI News·· 2025-04-02AI 评分38

PaperBench:评估 AI 智能体复现前沿 AI 研究的能力

PaperBench: Evaluating AI’s Ability to Replicate AI Research

AI 导读

OpenAI 推出 PaperBench,这是一个专门用于评估 AI 智能体复现前沿人工智能研究能力的基准测试。该基准旨在量化模型在重现最新科研成果方面的表现,为衡量 AI 系统的科研辅助能力提供标准化指标。

来源:OpenAI News · openai.com