跳到正文
热点事件观察中

Qwen3.8 27B 词语加法基准测试

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

2026年10月5日,Simon Willison 发布了一项针对本地 Qwen3.8-27B-Q4_K_M.gguf 模型的基准测试,检验其能否将正整数加法结果完全用英文单词表达。测试使用 5,070 个禁用推理的案例。结果显示,禁用推理时数值准确率为 23.57%,格式合规率为 96.17%;准确率随操作数位数增加而大幅下降,从一至三位操作数的 97.04% 跌至十至十三位的 6.44%。启用推理后,在 169 次配对测试中答对 167 次。

AI 根据报道生成 · 6 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Simon Willison
    Qwen3.8 27B 用英文单词做加法的基准测试

    一项基准测试用 5,070 个禁用推理的案例,检验本地 Qwen3.8-27B-Q4_K_M.gguf 能否把正整数加法结果完全用英文单词表达。禁用推理时数值准确率为 23.57%,格式合规率 96.17%,但准确率从一至三位操作数的 97.04% 跌至十至十三位的 6.44%。启用推理后,169 次配对测试中答对 167 次。

本事件热度走势

当前热度 5·可比范围峰值 6(10月6日 03:00)·近 24 小时可比范围变化 –

024610月6日03:0010月6日05:0010月6日07:0010月6日09:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。