跳到正文
评测来源

Arena Creative Writing

LMArena · 真人盲选故事、诗歌和其他创意表达,观察作品是否吸引读者。

官方评测
在 MyHOT 中参与排名
证据预算5%
上游数据时间09/30 08:00
最近成功同步10/02 05:34

它测什么,怎么测

读取官方数据集 text_style_control 的 creative_writing 分类,采用风格控制后的 Bradley–Terry 分与置信区间;不借用整体文本或职业写作分类成绩。

如何使用这份证据

正式计分;从原有真人偏好 10% 中拆分 5%,整体文本保留 5%,总预算不增加。与其他 Arena 任务共用证据家族。

评测成绩

按固定规则,每个公开模型采用一套代表配置;没有可采用配置的模型标为未计入并写明原因。匿名测试型号不展示,保留原榜名次,每项最多 30 个。

原榜名次原榜型号原始成绩代表配置
1gemini-4-argon-highgoogle1,521.8High 推理
2claude-opus-5.5-highAnthropic1,515High 推理
3claude-fable-5-highAnthropic1,503High 推理
4claude-opus-4-6-highAnthropic1,501.2High 推理
5gemini-3.7-flash-highGoogle1,495.6High 推理
6claude-opus-4-7-highAnthropic1,489.3High 推理
7gemini-3-proGoogle1,484.4来源默认配置
8gemini-3.8-flash-highGoogle1,484.4High 推理
10claude-fable-5.1-maxAnthropic1,481.6Max 推理
11gemini-3.1-pro-previewGoogle1,480.3来源默认配置
14gemini-3.6-flash-highGoogle1,471.8High 推理
15claude-opus-5-maxAnthropic1,469.5Max 推理
16claude-opus-4-8-highAnthropic1,469.4High 推理
18claude-opus-4-5-20251101-high-32kAnthropic1,469.1High 推理 · 32k
19gpt-5.6-sol-xhighOpenAI1,468.9xHigh 推理
20qwen3.8-maxAlibaba1,467.8来源默认配置
21muse-sparkMeta1,464.9来源默认配置
22gemini-3.5-flash-highGoogle1,463.8High 推理
24grok-4.20-beta1xAI1,462.5来源默认配置
26kimi-k3-maxMoonshot AI1,459.7来源默认配置
27muse-spark-1.3-maxMeta1,458.6Max 推理
28gemini-3-flashGoogle1,456.5来源默认配置
29gpt-5.5-instantOpenAI1,456.3来源默认配置
30glm-5.2-maxZ.ai1,455.3来源默认配置
31glm-5.3-maxZ.ai1,455.3来源默认配置
33muse-spark-1.2 (xHigh)Meta1,452.7xHigh 推理
34gpt-5.5-highOpenAI1,451.4High 推理
35grok-4.5xAI1,450.9来源默认配置
36claude-sonnet-4-5-20250929-high-32kAnthropic1,450.1High 推理 · 32k
37claude-sonnet-4-6Anthropic1,449.4来源默认配置
评测局限与数据署名

开放用户提示由分类器归类,并非全部为长篇小说或中文创作;投票包含个人偏好。与 Arena 整体文本及职业写作分类存在重叠,不能作为额外独立机构。

数据许可:CC BY 4.0 · Arena 官方 Hugging Face leaderboard-dataset;保留署名、来源链接并说明聚合改动。

成绩由 LMArena 发布,原始分数与 MyHOT 共识分使用不同尺度,不能直接相加。