用户反馈回归:三模型对照(含耗时)

测试环境 · 用户反馈回归题 · 共 34 题 · 2026-07-25

Kimi Kimi 思考版 GLM 思考版
一句话结论: 同一套环境、同一套题:GLM 思考版 33/34(97%)明显领先;普通 Kimi 25/34(74%);Kimi 思考版 24/34(71%),通过率没有因「开思考」变好,单题耗时却明显更长。差距主要在「做完后主动交给用户并收尾」。GLM 只差融资复杂填表一题:文件写好了,却没交到用户手里就停不下来。

测试集是什么

这套题不是凭空出的考题,而是把线上真实用户反馈整理成可复跑的 34 道回归题。目标:同一环境、同一题,看不同模型能不能把事做完、交到用户手里,以及大概要花多久。

怎么算过:聊天题正常说清楚就算过;要交文件的题,用户侧能下载到结果、任务能收尾才算过。耗时按单题从开跑到结束的墙钟时间。

题量分布(按能力)

读表提示

最大头是复杂业务出件(13 题)。

其次是中断后接着干(6 题)和创建技能(4 题)。

本轮新增维度:完成任务花费的时间(中位数 / 长尾)。

能力类别题数在考验什么典型场景
复杂业务出件13读材料、做分析、写出文件并主动交给用户招标审查、融资填表、经营分析、投标对比
中断后接着干6断了 / 失败后能不能收口交卷中断无最终回复、继续后仍报错
创建技能4把技能做出来并交付,别原地循环创建技能超时、重复步骤
问不清时能协作1缺信息先问清,再继续交卷澄清时无法回复
自动化少打扰2无人值守少追问,跑完有结果自动化新闻
文档加工2转换 / 翻译后交卷md 转 Word、翻译
日常对话质量2答对题、不乱码、不复读现金流问答
长任务扛得住1半小时量级不中途撂挑子半小时无结果
体验与收尾细节3文件名、预览、数字员工别卡重试交付物名称、产物预览
33/34GLM 思考版 · 97.1%
25/34Kimi · 73.5%
24/34Kimi 思考版 · 70.6%

通过率对照(%)

Kimi 开思考后通过率略降(74% → 71%),没有「思考就能多交几题」的红利。

完成任务耗时(中位数,秒)

公平对比看「三家都过的 20 题」:GLM ≈78s,Kimi ≈91s,Kimi 思考 ≈122s。

耗时多一维怎么看

通过率回答「能不能交卷」;耗时回答「交卷要等多久」。交得出但等太久,用户一样不满意。

模型通过率全部题中位全部题 P90 三家都过20题中位通过题平均
GLM 思考版97.1%130s269s78s143s
Kimi73.5%115s295s91s125s
Kimi 思考版70.6%142s949s122s246s
关于 Kimi 思考版: 本轮证据不支持「给 Kimi 开思考就能又稳又快」。它比普通 Kimi 更慢(同题中位大约慢三成;长尾更夸张),通过率还略低。个别技能创建题能多过,但整体账算下来不划算。

GLM 思考版唯一没过的题

融资填表(复杂 Excel)

唯一未过题

用户要的是:按融资需求说明生成分析表,并作为可下载文件交给用户。

实际发生了什么:Agent 其实已经写出了分析表文件,但没有主动呈现给用户、也没有结束任务,而是继续在「建表 / 导入」上打转,最后被系统因步骤过多强制打断。同题上普通 Kimi 本轮交成功了。

用人话说:活干了大半,文件也有了,但没把东西递到用户手里就停不下来。

  • 文件写好了却还在空转 → 系统自动交卷收尾
  • 反复改同一文件没进展 → 早停并换思路
  • 复杂填表先交最小可用结果,再迭代

建议

已经稳住的:长任务不再被误杀;服务本轮稳定;需要用户补充信息时也能续上。

生产默认优先用更会「做完就交卷」且不拖时间的模型(本轮证据支持 GLM 思考版)。Kimi 思考版不宜作为「靠开思考提升交付」的默认选项。平台继续补半成品自动交卷、路径纠偏、空转早停:既抬通过率,也削长尾等待。

数据来自同日同环境对照跑批 · Kimi / Kimi 思考版 / GLM 思考版 · 2026-07-25