OpenAI News·· 2023-05-31AI 评分52
OpenAI 发布基于过程监督提升数学推理能力的模型
Improving mathematical reasoning with process supervision
AI 导读
OpenAI 训练了一个在数学问题求解上达到新 SOTA 的模型,该模型通过奖励正确的推理步骤(过程监督)而非仅仅奖励正确答案(结果监督)进行优化。除了提升性能外,过程监督还带来了对齐优势,直接训练模型生成经人类认可的思维链。
来源:OpenAI News · openai.com