热点事件持续更新
Qwen3.8 27B 英文单词加法基准测试
1 篇报道1 个报道来源20 小时前更新
先了解这件事
AI 综述
2026年10月5日,Simon Willison 发布了一项针对本地 Qwen3.8-27B-Q4_K_M.gguf 模型的基准测试,用英文单词做加法。测试显示,在禁用推理时,模型数值准确率仅为 23.57%,格式合规率为 96.17%;准确率随数字位数增加而下降,从一至三位数的 97.04% 跌至十至十三位数的 6.44%。开启推理后,在 169 次单样本测试中答对 167 次。该实验在 DGX Spark 上复现了 GPT-4o 的同类测试。
AI 根据报道生成 · 2 小时前更新
最新进展10月5日 07:34
开启推理后,169 次单样本测试中答对 167 次。报道时间线
沿着报道,了解事件的不同侧面。
10月5日
- Simon WillisonQwen3.8 27B 用英文单词做加法的基准测试
本地 Qwen3.8-27B-Q4_K_M.gguf 在禁用推理时用英文单词做加法仅得 23.57% 数值准确率,格式合规率 96.17%,但准确率从一至三位数的 97.04% 跌至十至十三位数的 6.44%。开启推理后,169 次单样本测试中答对 167 次。该实验在 DGX Spark 上复现了 GPT-4o 的同类测试。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。