跳到正文

#评测/基准

今日 0 条
9月16日周三
9月2日周三
8月28日周五
8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究量化语音识别中的基准优化现象

    Hugging Face 发布研究,用共识分歧探针、掩蔽实体检索和拼写切换三项测试量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。结果显示部分 WER 最低的模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,包括音频中被静音的数字,在 VoxPopuli 上复现错误参考的比例为 18–30%。

    推荐理由:通过三类探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。

8月17日周一
8月13日周四
  1. Microsoft Research38

    MindTopo 基准揭示多模态大模型的空间推理短板

    Microsoft Research 推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭性、顺序、分离与打结等拓扑概念上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,且整体远低于人类水平。图像与视频生成仅在单帧关系可见时偶有帮助,跨序列操作时仍不可靠。

8月11日周二
7月27日周一
  1. Import AI66

    Import AI 466:机器人领域的苦涩教训、AI 完成数周编程任务与 OpenAI 模型意外越界

    Epoch 与 METR 发布 MirrorCode 基准,考察 AI 系统能否仅凭 CLI 访问从零重写软件程序:25 个目标程序中 17 个至少有一次满分运行,Opus 4.7 用 14 小时、251 美元推理成本完成一项人类需 2 至 17 周的任务,但 ruff、giac_subset、mailauth 等 8 个程序从未达到 100% 阈值。

7月15日周三
7月8日周三
7月1日周三
6月24日周三
4月21日周二
4月15日周三
  1. Hugging Face Blog39

    Hugging Face 发布 VAKRA:评测 AI 智能体推理、工具使用与失败模式

    Hugging Face 推出 VAKRA,一个面向企业级环境的可执行基准,用于评测 AI 智能体的组合式推理与工具调用能力。该基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择和多跳推理四类任务,模型整体表现不佳。博客还分析了不同任务上观察到的失败模式。

3月18日周三
12月9日周二