跳到正文
原文
Hugging Face Blog·· 2025-08-12AI 评分40

Hugging Face 推出 TextQuests:评估 LLM 在文本冒险游戏中的智能体能力

TextQuests: How Good are LLMs at Text-Based Video Games?

AI 导读

Hugging Face 发布基于 25 款 Infocom 经典游戏的 TextQuests 基准,测试 LLM 作为自主智能体的长上下文推理与探索学习能力。评测显示,当上下文超过 100K tokens 时,前沿模型常出现幻觉、动作重复及空间导航失败(如 Zork I 迷宫),难以有效构建心理地图。

来源:Hugging Face Blog · huggingface.co