跳到正文
原文
Hugging Face Blog·· 2026-04-15精选AI 评分60

IBM Research 发布 VAKRA 基准:揭示 AI Agent 推理与工具使用的失败模式

Inside VAKRA: Reasoning, Tool Use, and Failure Modes of Agents

AI 导读

IBM Research 推出 VAKRA,这是一个用于评估 AI Agent 在企业级环境中推理和行动能力的可执行基准测试。该基准包含超过 8000 个本地托管 API 和 62 个领域的真实数据库,要求模型完成 3-7 步的复杂推理链。分析显示,尽管现代模型能执行孤立工具调用,但在多跳推理、多源检索及遵守工具使用策略时表现不佳,暴露了从表面能力到端到端可靠性的差距。

推荐理由

IBM Research 在 Hugging Face 博客发布 VAKRA 基准测试,通过执行轨迹分析揭示了当前 AI Agent 在多步工作流中的具体失败模式。

来源:Hugging Face Blog · huggingface.co