今日模型横向对比 · E2E 39 题

prod_e2e(36 fb + 3 df)· warm=12 · workers=4 · 开发机 10.2.145.100 · 2026-08-04 · 主指标 Nominal,Validated 对照 · 8 档(含 K3 min / K3 开)
阿里 ×5 中台 ×2 电信 ×1 可比跑批(warm12)

背景:这批实验在测什么

同一套 prod_e2e_test_set(39 题)、同一机器与并发设定,对比阿里 MaaS、电信 CTAIGW、中台 AIMiddle。 排名与选型以 Nominal(present_files 成功)为主,Validated(交付实核)一并展示作对照。 首轮冷跑因沙箱不可用被污染,下表只用 warm=12 之后的可比批次。

题集

36 条反馈回归 + 3 条 df 门禁题。覆盖招标审查、融资填表、技能创建、经营分析、配矿等真实场景。

怎么读成功率

主看 Nominal = present_files 成功;Validated = 交付层实核通过,用于看「交了文件是否真过关」。

时延口径

单题 elapsed_sec 的中位 / P95;Wall = 整批墙钟(workers=4 并行)。

97.4%
并列第1 · K3 min / GLM / DS-Code
94.9%
第3 · 阿里 Qwen · nominal
92.3%
K3 开思考 · 92.3% 更慢
61.5%
末位 · 中台 Kimi 关 · nominal
拉通结论(以 Nominal 为主)

并列第一:阿里 glm-5.2 与中台 DeepSeek-V4-Flash-Code(均为 97.4% / 87.2%)。其后:阿里 Qwen 94.9%;阿里 DS-Flash 与新开通 Kimi K3 并列 92.3%(validated 均 84.6%)。电信 GLM 89.7%。中台 kimi-k2.6 关思考仍 61.5%。速度上阿里 DS-Flash 最快;K3 偏慢(中位 185s)。

交付成功率(n=39,Nominal 为主)

Nominal (%)Validated (%)
Source: warm12-w4 runs on 10.2.145.100 · 2026-08-04 · layer_summary.delivery_rates · 排序按 Nominal

单题时延(秒,越低越快)

Median (s)P95 (s)
Case-level elapsed_sec · 中台 Kimi 仅 35/39 有计时样本

整批墙钟(分钟,workers=4)

全量排行榜(按 Nominal)

名次模型网关思考 NominalNom%ValidatedVal% Med(s)P95(s)Wall(min)

按网关看

阿里 MaaS

三档 nominal 领先:GLM 97.4% → Qwen 94.9% → DS 92.3%。

validated 分别为 87.2% / 84.6% / 84.6%。DS-Flash 速度明显领先,适合高吞吐备选。

电信 CTAIGW

glm-5.2 开思考 nominal 89.7%,validated 84.6%。

单题更慢(中位 155s、整批 ~33min),质量够用但吞吐偏弱。

中台 AIMiddle

kimi-k2.6 关思考 nominal 仅 61.5%,validated 51.3%。

runner_error 10 条(含全部 df-*),今日不宜作主模型。

网关实验档位数该网关最高 Nominal对应 Validated对应模型
阿里3 档38/39 · 97.4%87.2%glm-5.2-alibaba 开思考
电信1 档35/39 · 89.7%84.6%glm-5.2-telecom 开思考
中台1 档24/39 · 61.5%51.3%kimi-k2.6-middle 关思考

失败结构

模型delivery 失败runner_error主要 case
阿里 GLM 开50fb-09 / fb-16 / fb-17 / fb-19 / fb-30
阿里 Qwen 开60fb-16 / fb-17 / fb-19 / fb-30 / fb-46 / fb-47
阿里 DS-Flash 开42delivery: fb-16/18/19/30 · runner: fb-17/33
电信 GLM 开51delivery: fb-16/17/19/34/46 · runner: fb-30
中台 Kimi 关910delivery 9 条 + runner 10 条(含 3 条 df-*)
共同失败(4 家头部共有)

fb-16 创建技能超时 · fb-17 澄清无回复入口仍继续 · fb-19 创建技能无交付提示 · fb-30 澄清时无法回复。更像技能创建/澄清收口的产品问题,不宜单怪某一家模型。

对照:首轮冷跑(勿与上表混比)

同日首轮 alibaba-maas-thinking(未充分 warm)GLM/Qwen nominal / validated 约 69% / 64% 与 67% / 62%,失败以 sandbox_unavailable / command_timeout 为主。上表 warm12 批次才反映模型本身交付能力。

选型建议(以 Nominal 为主)

交付优先 → 阿里 glm-5.2 开思考(nominal 最高)。质量与速度平衡 → 阿里 DeepSeek-V4-Flash(nominal 92.3%,整批最快;validated 与 Qwen/电信并列)。电信主路由备选 → glm-5.2 开思考(nominal 89.7%,时延更长)。中台 kimi-k2.6 今日偏弱,需排查 runner_error 后再谈选型。