用户反馈回归:Kimi 与 GLM 思考版对照

测试环境 · 用户反馈回归题 · 共 34 题 · 2026-07-25

Kimi GLM 思考版
一句话结论: 同一套环境、同一套题:GLM 思考版过了 33/34(97%),Kimi 过了 25/34(74%)。差距大约 24 个百分点,主要差在「听懂要交什么、做完后主动交给用户并收尾」,不是机器误杀或环境不稳。GLM 只差 1 题:融资复杂填表——文件已经生成,但没有主动交给用户就停不下来。

测试集是什么

这套题不是凭空出的考题,而是把线上真实用户反馈(卡死、交不出、答非所问、技能建不完等)整理成可复跑的 34 道回归题。目标很直接:同一环境、同一题,看不同模型能不能把用户要的事做完、交到用户手里。

怎么算过:聊天题正常说清楚就算过;要交文件的题,用户侧能下载到结果、任务能收尾才算过。

下面按「在考验 Agent 什么本事」归类,方便对照:差在出件、差在收尾,还是差在协作。

题量分布(按能力)

读表提示

最大头是复杂业务出件(13 题):读材料、写报告/表格并交卷。

其次是中断后接着干(6 题)和创建技能(4 题):线上反馈里「断了续不上」「技能做不完」很常见。

本轮 GLM 唯一没过的融资填表,就落在「复杂业务出件」:文件写好了,却没交到用户手里。

能力类别题数在考验什么典型场景
复杂业务出件13读材料、做分析、写出 Word/Excel/报告,并主动交给用户招标审查、融资填表、经营分析、投标对比、可研报告、双表分析
中断后接着干6上一轮断了、失败了、没最终回复时,能不能收口交卷,而不是瞎重跑或空转中断无最终回复、继续后仍报错、合成提示空转、邮件发送中断
创建技能4按要求把技能做出来并交付,步骤别原地循环创建技能超时、重复步骤、无交付提示、澄清后仍继续创建
问不清时能协作1缺信息时先问清楚,用户补充后还能继续做完并交卷澄清时无法回复
自动化少打扰2无人值守场景少追问,跑完要有结果摘要交给用户自动化新闻、自动化任务执行失败
文档加工2格式转换、翻译等「改完就交」的加工能力Markdown 转 Word、文档翻译
日常对话质量2答得对题、中文清楚、不乱码、不复读经营性现金流问答、办公能力列举
长任务扛得住1半小时量级任务能不能坚持做完,不中途撂挑子半小时无结果
体验与收尾细节3文件名好不好认、产物能不能预览、数字员工别卡在重试交付物名称、产物预览、数字员工停在重试
33/34GLM 思考版
25/34Kimi
24两边都过
9 / 1只 GLM / 只 Kimi

通过率对照(%)

聊天题:正常答完就算过。要交文件的题:用户侧能拿到结果并收尾才算过。

逐题胜负

两边一起过 24 题;GLM 多救回 9 题;只有融资填表是 Kimi 过、GLM 没过。


GLM 思考版唯一没过的题

融资填表(复杂 Excel)

唯一未过题

用户要的是:按融资需求说明生成分析表,并作为可下载文件交给用户。

实际发生了什么:Agent 其实已经写出了分析表文件,但没有主动呈现给用户、也没有结束任务,而是继续在「建表 / 导入」上打转,最后被系统因步骤过多强制打断。同题上 Kimi 本轮反而交成功了。

用人话说:

活干了大半,文件也有了,但没把东西递到用户手里就停不下来。


后续怎么改

  • 发现「文件已经写好了却还在空转」时,系统自动帮它交卷并收尾
  • 对反复改同一文件、没有新进展的行为早停并提醒换思路
  • 复杂填表任务先交一版能用的最小结果,再迭代完善
  • 单题加压复测,确认这类半成品失败能压下去

差距主要差在哪

平台这边:环境稳了,长任务也不再被误杀,问不清时也能续聊。真正拉开分数的,是模型会不会把「交给用户」当成做完的标准。

听懂 → 做到 → 交卷

GLM 更稳

更常把「要有可下载结果、并明确交给用户」当作硬要求,而不是聊到一半或做到一半就停。

招标审查、新闻自动化、经营分析、建技能这类题上更明显。

半途停 · 写错地方 · 有文件却不交

Kimi 更常栽在这

常见三种:中间步骤做完没有最终文件;文件写到用户拿不到的目录;文件其实已经有了,却反复修改停不下来,最后被系统强制打断。

用人话:不是机器死了,是「没收尾、没交卷」。

只 GLM 过、Kimi 没过的题(摘)

场景Kimi 大概卡在哪
招标审查Kimi 做完中间步骤后,没有把审查意见文件交出来
自动化新闻Kimi 停在配置排查,没有产出结果文件
创建技能Kimi 中途异常结束,任务没收尾
技能路径Kimi 把文件写到了错误目录,用户侧拿不到
空转触顶(1)磁盘上已有表格,但仍反复改表,直到系统强制结束
空转触顶(2)同上:已有产物,却没交给用户就停不下来
澄清场景需要用户补充信息时,Kimi 没走通;GLM 能交卷
空转触顶(3)同上:有文件却没呈现给用户
经营分析读样例表缺页后放弃,没有最终交付

平台还要不要继续砸、怎么砸

已经稳住的: 长任务不再被误杀;服务本轮稳定;需要用户补充信息时也能续上。这类「环境把任务掐死」的硬伤,本轮基本看不到了。

已经兜住的

  • 长时间干活不被误杀
  • 澄清后能继续聊、继续做
  • 网关和沙箱本轮正常

还能再补的安全带

  • 已有文件却还在空转 → 自动交卷收尾
  • 写错目录 → 纠回到用户能下载的位置
  • 原地打转 → 早停并换思路

单靠平台抬不动的

  • 模型是否把「交卷」当成完成标准
  • 复杂填表里没完没了的无效循环
  • 模型选型本身的能力差

建议

生产默认优先用更会「做完就交卷」的模型(本轮证据支持 GLM 思考版)。平台继续补「半成品自动交卷、写错路径纠偏、空转早停」这几条安全带,目标是把融资填表这类「东西写好了却没递到用户手里」压到接近零——而不是指望平台把模型差距完全抹平。

数据来自同日同环境对照跑批 · Kimi vs GLM 思考版 · 2026-07-25