跳到正文
原文
Google Research·· 2026-04-03AI 评分42

Google Research 评估 LLM 行为倾向与人类对齐

Evaluating alignment of behavioral dispositions in LLMs

AI 导读

Google Research 提出框架评估 25 个 LLM 的行为倾向,发现模型在共识场景下存在方向性偏差,且在无共识时无法覆盖人类意见范围。该研究利用情境判断测试(SJT)替代自报问卷,通过对比模型响应与 10 名标注者偏好分布,量化模型在共情、情绪调节等特质上与人类行为的对齐程度。

来源:Google Research · research.google