用同一批真实业务场景,横向比较阿里、中台、电信几家模型的交付能力与速度。 排名以基本交付率为主,验证后交付率一并对照。 Kimi K3「轻量」表示深度推理尽量收束,「深度」表示深度推理开得更满。
36 道反馈回归题 + 3 道门禁题。覆盖招标审查、融资填表、技能创建、经营分析、配矿等。
基本交付率:是否给出了可用交付物。验证后交付率:交付物是否经核对真正过关。
单题中位耗时 / 偏慢题耗时;整批完成时间看一次跑完 39 题要多久。
并列第一(97.4% / 87.2%):阿里 Kimi K3 轻量、阿里 GLM。阿里 DeepSeek Flash 最优表现到 94.9% / 89.7%,与 Qwen 基本交付率持平,但验证后交付率更高,且整批最快(约 15 分钟)。中台 Flash-Code 约 89.8% / 84.6%,与电信 GLM 同档。中台 Kimi 关闭深度推理后明显偏弱。
轻量相对深度:基本交付率更高(92.3%→97.4%),验证后交付率也更好,整批大约快一倍(约 36 分钟→18 分钟),执行异常更少。若选用 K3,优先轻量设定。
| 名次 | 模型 | 渠道 | 深度推理 | 基本交付 | 基本交付率 | 验证后交付 | 验证后交付率 | 中位(秒) | 偏慢(秒) | 整批(分) |
|---|
| 模型 | 交付未过关 | 执行异常 | 主要表现 |
|---|---|---|---|
| 阿里 Kimi K3 轻量 | 5 | 0 | 创建技能超时、澄清卡住、经营分析无产物等 |
| 阿里 GLM | 5 | 0 | 新闻任务、创建技能、澄清卡住等 |
| 阿里 DeepSeek Flash | 2 | 2 | 创建技能 / 澄清;另有 2 条执行异常 |
| 阿里 Qwen | 6 | 0 | 创建技能、澄清、经营分析等 |
| 阿里 Kimi K3 深度 | 4 | 2 | 澄清与经营分析;另有 2 条执行异常 |
| 中台 DeepSeek Flash-Code | 6 | 0 | 创建技能、澄清、经营分析、配矿等 |
| 电信 GLM | 5 | 1 | 创建技能、澄清、无产物;另有 1 条执行异常 |
| 中台 Kimi(关深度) | 9 | 10 | 交付失败多,执行异常也偏多 |
创建技能超时、澄清后无法继续、创建技能无交付提示等,更像产品流程问题,不宜单怪某一家模型。
交付优先 → 阿里 Kimi K3 轻量 / GLM。质量与速度平衡 → 阿里 DeepSeek Flash(94.9% / 89.7%,整批最快)。中台备选 → Flash-Code(约 89.8%);避开中台 Kimi 关深度。K3 优先轻量,不必开满深度推理。