跳到正文
原文
Hugging Face Blog·· 2026-04-15AI 评分39

Hugging Face 发布 VAKRA:评测 AI 智能体推理、工具使用与失败模式

Inside VAKRA: Reasoning, Tool Use, and Failure Modes of Agents

AI 导读

Hugging Face 推出 VAKRA,一个面向企业级环境的可执行基准,用于评测 AI 智能体的组合式推理与工具调用能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择和多跳推理四类任务,模型整体表现不佳。博客还分析了不同任务上观察到的失败模式。

来源:Hugging Face Blog · huggingface.co