用户反馈回归:Kimi 与 GLM 思考版对照
测试环境 · 用户反馈回归题 · 共 34 题 · 2026-07-25
测试集是什么
这套题不是凭空出的考题,而是把线上真实用户反馈(卡死、交不出、答非所问、技能建不完等)整理成可复跑的 34 道回归题。目标很直接:同一环境、同一题,看不同模型能不能把用户要的事做完、交到用户手里。
怎么算过:聊天题正常说清楚就算过;要交文件的题,用户侧能下载到结果、任务能收尾才算过。
下面按「在考验 Agent 什么本事」归类,方便对照:差在出件、差在收尾,还是差在协作。
题量分布(按能力)
读表提示
最大头是复杂业务出件(13 题):读材料、写报告/表格并交卷。
其次是中断后接着干(6 题)和创建技能(4 题):线上反馈里「断了续不上」「技能做不完」很常见。
本轮 GLM 唯一没过的融资填表,就落在「复杂业务出件」:文件写好了,却没交到用户手里。
| 能力类别 | 题数 | 在考验什么 | 典型场景 |
|---|---|---|---|
| 复杂业务出件 | 13 | 读材料、做分析、写出 Word/Excel/报告,并主动交给用户 | 招标审查、融资填表、经营分析、投标对比、可研报告、双表分析 |
| 中断后接着干 | 6 | 上一轮断了、失败了、没最终回复时,能不能收口交卷,而不是瞎重跑或空转 | 中断无最终回复、继续后仍报错、合成提示空转、邮件发送中断 |
| 创建技能 | 4 | 按要求把技能做出来并交付,步骤别原地循环 | 创建技能超时、重复步骤、无交付提示、澄清后仍继续创建 |
| 问不清时能协作 | 1 | 缺信息时先问清楚,用户补充后还能继续做完并交卷 | 澄清时无法回复 |
| 自动化少打扰 | 2 | 无人值守场景少追问,跑完要有结果摘要交给用户 | 自动化新闻、自动化任务执行失败 |
| 文档加工 | 2 | 格式转换、翻译等「改完就交」的加工能力 | Markdown 转 Word、文档翻译 |
| 日常对话质量 | 2 | 答得对题、中文清楚、不乱码、不复读 | 经营性现金流问答、办公能力列举 |
| 长任务扛得住 | 1 | 半小时量级任务能不能坚持做完,不中途撂挑子 | 半小时无结果 |
| 体验与收尾细节 | 3 | 文件名好不好认、产物能不能预览、数字员工别卡在重试 | 交付物名称、产物预览、数字员工停在重试 |
通过率对照(%)
聊天题:正常答完就算过。要交文件的题:用户侧能拿到结果并收尾才算过。
逐题胜负
两边一起过 24 题;GLM 多救回 9 题;只有融资填表是 Kimi 过、GLM 没过。
GLM 思考版唯一没过的题
融资填表(复杂 Excel)
唯一未过题用户要的是:按融资需求说明生成分析表,并作为可下载文件交给用户。
实际发生了什么:Agent 其实已经写出了分析表文件,但没有主动呈现给用户、也没有结束任务,而是继续在「建表 / 导入」上打转,最后被系统因步骤过多强制打断。同题上 Kimi 本轮反而交成功了。
用人话说:
活干了大半,文件也有了,但没把东西递到用户手里就停不下来。
后续怎么改
- 发现「文件已经写好了却还在空转」时,系统自动帮它交卷并收尾
- 对反复改同一文件、没有新进展的行为早停并提醒换思路
- 复杂填表任务先交一版能用的最小结果,再迭代完善
- 单题加压复测,确认这类半成品失败能压下去
差距主要差在哪
平台这边:环境稳了,长任务也不再被误杀,问不清时也能续聊。真正拉开分数的,是模型会不会把「交给用户」当成做完的标准。
听懂 → 做到 → 交卷
GLM 更稳更常把「要有可下载结果、并明确交给用户」当作硬要求,而不是聊到一半或做到一半就停。
招标审查、新闻自动化、经营分析、建技能这类题上更明显。
半途停 · 写错地方 · 有文件却不交
Kimi 更常栽在这常见三种:中间步骤做完没有最终文件;文件写到用户拿不到的目录;文件其实已经有了,却反复修改停不下来,最后被系统强制打断。
用人话:不是机器死了,是「没收尾、没交卷」。
只 GLM 过、Kimi 没过的题(摘)
| 场景 | Kimi 大概卡在哪 |
|---|---|
| 招标审查 | Kimi 做完中间步骤后,没有把审查意见文件交出来 |
| 自动化新闻 | Kimi 停在配置排查,没有产出结果文件 |
| 创建技能 | Kimi 中途异常结束,任务没收尾 |
| 技能路径 | Kimi 把文件写到了错误目录,用户侧拿不到 |
| 空转触顶(1) | 磁盘上已有表格,但仍反复改表,直到系统强制结束 |
| 空转触顶(2) | 同上:已有产物,却没交给用户就停不下来 |
| 澄清场景 | 需要用户补充信息时,Kimi 没走通;GLM 能交卷 |
| 空转触顶(3) | 同上:有文件却没呈现给用户 |
| 经营分析 | 读样例表缺页后放弃,没有最终交付 |
平台还要不要继续砸、怎么砸
已经兜住的
- 长时间干活不被误杀
- 澄清后能继续聊、继续做
- 网关和沙箱本轮正常
还能再补的安全带
- 已有文件却还在空转 → 自动交卷收尾
- 写错目录 → 纠回到用户能下载的位置
- 原地打转 → 早停并换思路
单靠平台抬不动的
- 模型是否把「交卷」当成完成标准
- 复杂填表里没完没了的无效循环
- 模型选型本身的能力差
建议
生产默认优先用更会「做完就交卷」的模型(本轮证据支持 GLM 思考版)。平台继续补「半成品自动交卷、写错路径纠偏、空转早停」这几条安全带,目标是把融资填表这类「东西写好了却没递到用户手里」压到接近零——而不是指望平台把模型差距完全抹平。
数据来自同日同环境对照跑批 · Kimi vs GLM 思考版 · 2026-07-25