KunMate 多供应商模型横向对比 · 39 道业务场景

同一套业务题、同一环境可比跑批 · 2026-08-04 · 主看基本交付率 · 共 8 档模型
阿里 ×5 中台 ×2 电信 ×1 条件对齐后可比

背景:这批实验在测什么

用同一批真实业务场景,横向比较阿里、中台、电信几家模型的交付能力与速度。 排名以基本交付率为主,验证后交付率一并对照。 Kimi K3「轻量」表示深度推理尽量收束,「深度」表示深度推理开得更满。

题集

36 道反馈回归题 + 3 道门禁题。覆盖招标审查、融资填表、技能创建、经营分析、配矿等。

怎么读成功率

基本交付率:是否给出了可用交付物。验证后交付率:交付物是否经核对真正过关。

怎么读速度

单题中位耗时 / 偏慢题耗时;整批完成时间看一次跑完 39 题要多久。

97.4%
并列第1 · K3 轻量 / GLM
94.9% / 89.7%
阿里 DeepSeek Flash 最优表现
89.8%
中台 Flash-Code · 基本交付率
61.5%
末位 · 中台 Kimi 关深度
拉通结论(以基本交付率为主)

并列第一(97.4% / 87.2%):阿里 Kimi K3 轻量、阿里 GLM。阿里 DeepSeek Flash 最优表现到 94.9% / 89.7%,与 Qwen 基本交付率持平,但验证后交付率更高,且整批最快(约 15 分钟)。中台 Flash-Code 约 89.8% / 84.6%,与电信 GLM 同档。中台 Kimi 关闭深度推理后明显偏弱。

Kimi K3:轻量 vs 深度

轻量相对深度:基本交付率更高(92.3%→97.4%),验证后交付率也更好,整批大约快一倍(约 36 分钟→18 分钟),执行异常更少。若选用 K3,优先轻量设定。

交付成功率(39 题,基本交付率为主)

基本交付率 (%)验证后交付率 (%)
2026-08-04 · 条件对齐可比批次 · 按基本交付率排序

单题耗时(秒,越低越快)

中位耗时 (秒)偏慢题耗时 (秒)

整批完成时间(分钟)

全量排行榜(按基本交付率)

名次模型渠道深度推理 基本交付基本交付率验证后交付验证后交付率 中位(秒)偏慢(秒)整批(分)

失败情况概览

模型交付未过关执行异常主要表现
阿里 Kimi K3 轻量50创建技能超时、澄清卡住、经营分析无产物等
阿里 GLM50新闻任务、创建技能、澄清卡住等
阿里 DeepSeek Flash22创建技能 / 澄清;另有 2 条执行异常
阿里 Qwen60创建技能、澄清、经营分析等
阿里 Kimi K3 深度42澄清与经营分析;另有 2 条执行异常
中台 DeepSeek Flash-Code60创建技能、澄清、经营分析、配矿等
电信 GLM51创建技能、澄清、无产物;另有 1 条执行异常
中台 Kimi(关深度)910交付失败多,执行异常也偏多
多家共同卡点

创建技能超时、澄清后无法继续、创建技能无交付提示等,更像产品流程问题,不宜单怪某一家模型。

选型建议(以基本交付率为主)

交付优先 → 阿里 Kimi K3 轻量 / GLM。质量与速度平衡 → 阿里 DeepSeek Flash(94.9% / 89.7%,整批最快)。中台备选 → Flash-Code(约 89.8%);避开中台 Kimi 关深度。K3 优先轻量,不必开满深度推理。