跳到正文
原文
Hugging Face Blog·· 2026-06-18精选AI 评分62

Hugging Face 发布 agent-eval:在自有工具上评测开源模型的智能体能力

Is it agentic enough? Benchmarking open models on your own tooling

AI 导读

Hugging Face 发布 agent-eval 评测工具,用 transformers 作为案例,衡量智能体完成任务的过程成本而非只看最终答案。该工具在 bare、clone、skill 三种层级下运行模型×版本×任务的组合,每个组合作为独立 Hugging Face Job 在相同硬件上并行执行,并记录 match %、时间、token 和错误率等指标。

推荐理由

Hugging Face 用自家 transformers 做案例,展示如何衡量智能体使用工具的过程成本而非只看最终答案。

来源:Hugging Face Blog · huggingface.co