同一套 prod_e2e_test_set(39 题)、同一机器与并发设定,对比阿里 MaaS、电信 CTAIGW、中台 AIMiddle。
排名与选型以 Nominal(present_files 成功)为主,Validated(交付实核)一并展示作对照。
首轮冷跑因沙箱不可用被污染,下表只用 warm=12 之后的可比批次。
36 条反馈回归 + 3 条 df 门禁题。覆盖招标审查、融资填表、技能创建、经营分析、配矿等真实场景。
主看 Nominal = present_files 成功;Validated = 交付层实核通过,用于看「交了文件是否真过关」。
单题 elapsed_sec 的中位 / P95;Wall = 整批墙钟(workers=4 并行)。
第一:阿里 glm-5.2 开思考(nominal 97.4%,validated 87.2%)。其后依次:阿里 Qwen 94.9%、阿里 DS-Flash 92.3%、电信 GLM 89.7%;三档 validated 同为 84.6%,差距主要在 nominal。DS-Flash 速度明显领先(中位 70s、整批约 15 分钟)。中台 kimi-k2.6 关思考 nominal 仅 61.5%(validated 51.3%),且有 10 条 runner_error。头部共同失败仍集中在技能创建/澄清类(fb-16/17/19/30)。
| 名次 | 模型 | 网关 | 思考 | Nominal | Nom% | Validated | Val% | Med(s) | P95(s) | Wall(min) |
|---|
三档 nominal 领先:GLM 97.4% → Qwen 94.9% → DS 92.3%。
validated 分别为 87.2% / 84.6% / 84.6%。DS-Flash 速度明显领先,适合高吞吐备选。
glm-5.2 开思考 nominal 89.7%,validated 84.6%。
单题更慢(中位 155s、整批 ~33min),质量够用但吞吐偏弱。
kimi-k2.6 关思考 nominal 仅 61.5%,validated 51.3%。
runner_error 10 条(含全部 df-*),今日不宜作主模型。
| 网关 | 实验档位数 | 该网关最高 Nominal | 对应 Validated | 对应模型 |
|---|---|---|---|---|
| 阿里 | 3 档 | 38/39 · 97.4% | 87.2% | glm-5.2-alibaba 开思考 |
| 电信 | 1 档 | 35/39 · 89.7% | 84.6% | glm-5.2-telecom 开思考 |
| 中台 | 1 档 | 24/39 · 61.5% | 51.3% | kimi-k2.6-middle 关思考 |
| 模型 | delivery 失败 | runner_error | 主要 case |
|---|---|---|---|
| 阿里 GLM 开 | 5 | 0 | fb-09 / fb-16 / fb-17 / fb-19 / fb-30 |
| 阿里 Qwen 开 | 6 | 0 | fb-16 / fb-17 / fb-19 / fb-30 / fb-46 / fb-47 |
| 阿里 DS-Flash 开 | 4 | 2 | delivery: fb-16/18/19/30 · runner: fb-17/33 |
| 电信 GLM 开 | 5 | 1 | delivery: fb-16/17/19/34/46 · runner: fb-30 |
| 中台 Kimi 关 | 9 | 10 | delivery 9 条 + runner 10 条(含 3 条 df-*) |
fb-16 创建技能超时 · fb-17 澄清无回复入口仍继续 · fb-19 创建技能无交付提示 · fb-30 澄清时无法回复。更像技能创建/澄清收口的产品问题,不宜单怪某一家模型。
同日首轮 alibaba-maas-thinking(未充分 warm)GLM/Qwen nominal / validated 约 69% / 64% 与 67% / 62%,失败以 sandbox_unavailable / command_timeout 为主。上表 warm12 批次才反映模型本身交付能力。
交付优先 → 阿里 glm-5.2 开思考(nominal 最高)。质量与速度平衡 → 阿里 DeepSeek-V4-Flash(nominal 92.3%,整批最快;validated 与 Qwen/电信并列)。电信主路由备选 → glm-5.2 开思考(nominal 89.7%,时延更长)。中台 kimi-k2.6 今日偏弱,需排查 runner_error 后再谈选型。