跳到正文
热点事件持续更新

Qwen3.8 27B 英文单词加法基准测试

1 篇报道1 个报道来源20 小时前更新

先了解这件事

AI 综述

2026年10月5日,Simon Willison 发布了一项针对本地 Qwen3.8-27B-Q4_K_M.gguf 模型的基准测试,用英文单词做加法。测试显示,在禁用推理时,模型数值准确率仅为 23.57%,格式合规率为 96.17%;准确率随数字位数增加而下降,从一至三位数的 97.04% 跌至十至十三位数的 6.44%。开启推理后,在 169 次单样本测试中答对 167 次。该实验在 DGX Spark 上复现了 GPT-4o 的同类测试。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Simon Willison
    Qwen3.8 27B 用英文单词做加法的基准测试

    本地 Qwen3.8-27B-Q4_K_M.gguf 在禁用推理时用英文单词做加法仅得 23.57% 数值准确率,格式合规率 96.17%,但准确率从一至三位数的 97.04% 跌至十至十三位数的 6.44%。开启推理后,169 次单样本测试中答对 167 次。该实验在 DGX Spark 上复现了 GPT-4o 的同类测试。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。