DeepSeek V4 Pro 路口调度测试最终报告
- 有效运行:
deepseek-v4-pro_2026-10-01_152631644-43700(三次中得分最高;规则版本 16,种子 63916,tick 61–261,44 个决策周期) - 其余运行:
deepseek-v4-pro_2026-10-01_114857334-103796、deepseek-v4-pro_2026-10-01_124426092-121024(只用于稳定性对比) - 数据来源:
report/select-best-run.mjs与report/analyze-run.mjs的输出,加上对原始推理日志的人工判读 - 复现命令:
node report/select-best-run.mjs --model deepseek-v4-pro,然后node report/analyze-run.mjs logs/replay_deepseek-v4-pro_2026-10-01_152631644-43700.json
结论摘要
DeepSeek V4 Pro 有效运行得分 740.17。它比 balanced baseline(674.49)高 65.68,比 search baseline(788.38)低 48.21。三次运行的均值为 705.46,标准差 24.56,是四个模型里最稳定的。最大的优点是"会算账、会处理特情":整局锁格扣费只有 5.38,所有 10 次抛锚都在 1–10 拍内派出拖车,6 起事故都在 1 拍内下了清障令。行人处理在四个模型里也最好,合法放行 21 名行人。最大的问题仍是行人碰撞:6 名伤员共罚 30,而且最后 52 拍放行速度下降,上游积压罚款达 42.54。
- 特情处理最成熟。 整局用了 11 种工具,只有车道引导没用过,抛锚平均 4.2 拍内派拖车。
- 行人博弈最好但仍不够。 61 次行人相位尝试中 10 次成功,合法放行 21 人。但在行人耐心告急时仍放行了 80 车次经过该横道的车辆,最终 6 人受伤。
- 路线-横道判断前半局准、后半局变差。 前半局 84 条断言只错 3 条,后半局 157 条错了 22 条,整局正确率 89.6%。错误集中在混乱的后半局,并直接导致 c25 一次连伤 3 名行人。
0. 分数与稳定性
| 排名 | 运行 | 最终余额 | 放行车辆 | 事故 | API 调用 | 工具成功率 | 行人相位成功/尝试 | 横道断言正确率 |
|---|---|---|---|---|---|---|---|---|
| 1 | 152631644-43700 | 740.17 | 129 | 6 | 161 | 72.4% | 10/61 | 89.6% |
| 2 | 114857334-103796 | 689.28 | 107 | 5 | 206 | 73.5% | 8/59 | 76.2% |
| 3 | 124426092-121024 | 686.92 | 122 | 4 | 212 | 79.2% | 8/65 | 75.8% |
均值 705.46,最低 686.92,标准差 24.56。三次都高于 balanced baseline,说明稳定发挥在 baseline 之上。最好的一次比另外两次高约 52 分,差距主要在锁格扣费:最佳一局只有 5.38,另外两局分别是 34.70 和 53.60(第三局还有 20 的校车罚款)。
| 策略 | 最终余额 | 放行车辆 | 未服务负债 | 事故 | 锁格扣费 | 上游积压 | 撞人 | 闯红灯罚 | 校车 | 拖车 |
|---|---|---|---|---|---|---|---|---|---|---|
| deepseek-v4-pro | 740.17 | 129 | 194.1 | 6 | 5.38 | 51.52 | 30 | 3.7 | 0 | 12.0 |
| baseline-balanced | 674.49 | 84 | 219.6 | 6 | 21.30 | 58.85 | 25 | 5.5 | 0 | 8.4 |
| baseline-search | 788.38 | 122 | 185.4 | 2 | 3.69 | 45.85 | 10 | 6.7 | 0 | 8.4 |
余额拆解:起始 1000,局内累计变化 −67.18,终局通行费 +1.46,未服务负债 −194.1(还有 409 辆车没服务完),合计 740.17。
| 时间段 | 周期数 | 放行车辆 | 局内余额变化 | 上游积压 | 撞人 |
|---|---|---|---|---|---|
| tick 61–140 | 8 | 62 | −8.81 | 1.68 | 0 |
| tick 140–175 | 8 | 25 | +1.61 | 3.99 | 0 |
| tick 175–210 | 12 | 20 | −15.78 | 3.32 | 25 |
| tick 210–261 | 16 | 22 | −44.20 | 42.54 | 5 |
相对 search baseline 的 48 分差距里,撞人多罚 20,上游积压多 5.7,未服务负债多 8.7,拖车多 3.6。
1. 基础分析
1.1 上下文能力
| 指标 | 数值 |
|---|---|
| 每次请求 prompt tokens | 平均 25,831,P95 50,035,最大 56,797(v16 观测未压缩) |
| 每次回复推理 tokens | 平均 7,764,P95 25,551,最大 40,487 |
| 每周期 API 轮数 | 平均 3.7,最多 7(上限 8) |
| 工具参数里的 ID | 469 个,100% 能在当轮上下文中找到 |
| 非规范 ID / 重复失败调用 | 0 / 0 |
| working memory | 1 次,因超过 160 字符被拒 |
判读:在平均 25k、最长 57k token 的上下文中,ID 引用零错误。模型较多引用跨周期信息:recentCycles 关注率 0.93,lastSettlement 0.74。代价是推理极长,平均每次回复 2.8 万字符,自我修正标记 4,093 次(平均每次 25.4 个)。
1.2 注意力分布
v16 的观测里没有车道矩阵、出口和 reservedUntil 等字段(v17 才引入),这些概念不参与统计。
| 关注较多(≥0.95) | 关注中等(0.75–0.95) | 关注较少 |
|---|---|---|
| 停止线候选、横道、候选冲突、行人预警、紧急车、抛锚、时间预算(均为 1.0);hold 0.97;正在放行车道 0.96 | 司机预警 0.94、上周期回顾 0.93、在路口车辆 0.93、被撤销放行 0.91、车道引导机会 0.89 | 上次结算 0.74 |
| 唤醒原因 | 次数 | 有响应 | 响应率 |
|---|---|---|---|
| ACCIDENT_INTERRUPT | 7 | 7 | 1.00 |
| VEHICLE_RED_LIGHT | 1 | 1 | 1.00 |
| PEDESTRIAN_PATIENCE | 20 | 15 | 0.75 |
| PEDESTRIAN_JAYWALK | 7 | 4 | 0.57 |
判读:注意力分布很均衡,行人耐心中断的响应率 0.75,是四个模型中最高的。对在路口行驶车辆的关注率 0.93,也是四个模型中最高的,这与它很少出现连环事故是一致的。
1.3 tool_call 准确性
整体 221 次调用,成功率 72.4%;35 次回复并行发出多个工具调用,最多一次 6 个。
| 工具 | 调用 | 成功率 | 说明 |
|---|---|---|---|
| dry_run_admit | 90 | 35.6% | 资源冲突 42、额度用完 11、车道头未就绪 3、规划视野超限 2、超过 16 车上限 1 |
| commit_schedule | 44 | 97.7% | — |
| inspect_crosswalk / inspect_incident / inspect_lane_queue | 23 / 21 / 12 | 100% | 用检查工具补全信息 |
| order_accident_clearance / dispatch_tow_truck / set_lane_detour / reroute_queue_around_stall | 12 / 10 / 5 / 2 | 100% | — |
| dispatch_emergency_convoy | 1 | 0% | c26 对 V00137 调用,返回 NOT_LANE_HEAD |
| manage_working_memory | 1 | 0% | 计划超过 160 字符 |
判读:试算成功率低,主要因为它大量把行人相位和车辆放在一起试算,冲突多是"真实冲突",不是格式错误。格式错误只有 1 次。
1.4 Agent 能力
| 指标 | 数值 |
|---|---|
| 先试算再提交 | 100%(所有有提交的周期) |
| 提交构成 | verified 20、unverified 6、hold 18 |
| 每周期放行车数 | 平均 2.9,最多 16 |
| 速度档位 | 全部 CRUISE(40 次) |
| sleep_ticks | 10 拍 15 次,5 拍和 8 拍各 7 次 |
| 决策开销 | API 161 次扣 3.22,非终结工具 177 次扣 0.27 |
判读:流程纪律是满分,每次提交前都试算过。周期数只有 44 个(四个模型中最少),靠大波次和较长的睡眠节省决策开销。缺点是从不用 BURST,也没用过车道引导。
2. 进阶分析
2.1 逻辑推理
- 横道几何前准后差。 241 条断言正确率 89.6%。错误样例:
- c12:「S_R1_RIGHT which doesn't cross E」(实际经过南、东横道)。
- c22:「E_R1_RIGHT (if we admit, east right = south, crosses SOUTH」(实际经过东、北横道,模型把右转方向弄反了)。
- c24:「N_R1_RIGHT eastbound should cross EAST」(实际经过北、西横道)。
- 会推理司机行为。 c37 t235 的推理:「If V00040 runs red while W_S1/W_S2 are admitted, collision! … So we MUST either admit V00040 (to legalize it) or ensure it can't run」。它准确预判了停在左转停止线、耐心为 0 的车会闯红灯,于是主动放行它们,把违规变成合法通行。思路正确,但执行时漏判了西横道(见 2.4 第 3 条)。
- 纠错效率中等。 试算失败(不含额度用完)47 次,再试 25 次,成功 10 次(40%);失败所在周期 32 次最终 hold。
- "说安全却冲突" 27 次,例如 c13 t153,推理「So no conflict with EAST crosswalk」,试算却撞上
CROSSWALK:EAST:CELL:6:0 vs V00043。v16 横道看不到未来车辆预约,这类错误有一部分是环境造成的。
2.2 复杂环境博弈
行人。 61 次相位尝试,10 次成功,共 7 批合法放行 21 人:
- c17 t175:东横道 2 人。
- c28 t200:北横道 4 人、南横道 2 人。
- c38 t236:东横道 3 人、北横道 2 人、南横道 2 人。
- c41 t244:西横道双向 6 人。
闯红灯只有 7 人,是四个模型中最少的。但 80 车次"耐心告急时放行经过该横道的车辆"仍然导致 6 人受伤,其中 4 人被撞前就在告急预警里。
事故。 6 起都是撞行人的 SERIOUS 侧撞。只有 INC0005 卷入两辆车,因为闯红灯的 V00095 追了上来,其余 5 起都是单车。没有发生连环事故,首次响应全在发生后 1 拍内:
| 事故 | 发生 | 车辆 / 路线 | 放行周期 | 关闭 |
|---|---|---|---|---|
| INC0001 | 176 | V00087 / W_S2_STRAIGHT | c12 | 193 |
| INC0002 | 179 | V00107 / N_R1_RIGHT(尾随者) | c14 | 194 |
| INC0003 | 195 | V00098 / E_L1_LEFT | c25 | 210 |
| INC0004 | 198 | V00149 / E_S1_STRAIGHT | c25 | 213 |
| INC0005 | 199 | V00129 / W_R1_RIGHT + 闯红灯 V00095 | c25 | 216 |
| INC0006 | 255 | V00067 / S_L1_LEFT | c37 | 局终 |
抢行司机。 V00095(激进型)在 14 个周期里都出现在司机预警里。c12 模型把它放进 W_S2 top-4("includes tailgate V00095"),但 tick 166 因前方有闯红灯行人被撤销放行;tick 199 它自己闯红灯,卷入 INC0005。
紧急车辆与抛锚。 10 次抛锚的派车延迟为 1–10 拍,是四个模型中最快的。紧急车 V00050 和 V00137 分别等了 104 和 105 拍,唯一一次紧急车队调用失败了(c26,NOT_LANE_HEAD),之后没有再试。
2.3 亮眼操作
- c2 t71:一个周期处理抛锚并放行 12 辆车。 同时调用
dispatch_tow_truck(V00014)、reroute_queue_around_stall(V00074 绕开 V00014),再试算一次就通过,放行北向直行、东向和 S_S1 共 12 辆车,全部 verified,无一出事。 - c5 t96:东西直行 14 车波次。 战术摘要:「Run E-W straight wave (E_S1,E_S2,W_S1,W_S2) 14 vehicles ~18.2 reward」,试算一次通过。
- c41 t244:西横道双向放行 6 名行人,是四个模型中单批放行行人最多的一次。
- c43 t256:利用终局规则。 先检查事故、下令清障 INC0006,再放行 16 辆车,推理写道「Committed verified straight-lane batches … to move heads past stopline before endTick; tailgate risks enter after endTick so inert」。它理解了只剩 5 拍时,后续车辆的尾随风险已经不会兑现。
- 抛锚处理模板化。 10 次抛锚平均 4.2 拍派拖车,c10 t142 还对 V00089 同时派拖车并让 V00110、V00117 绕行。
2.4 最差操作
- c25 t195:一次 unverified 提交导致 3 起撞人事故。 观测里西横道两名行人耐心只剩 4 和 5,南横道剩 10。模型写道「Dropped NORTH-crossing lanes … admitted safe E_L1/E_S1/W_R1」。但 E_L1 经过东、南横道,E_S1 经过东、西横道,W_R1 经过西、南横道,三条"安全"路线全部经过告急横道。最终的提交也与试算结果不一致。tick 195–199 先后发生 INC0003、INC0004、INC0005,3 名行人受伤,估算成本约 18。
- c12 t151:东西直行波次撞上东横道行人。 当时东横道有行人耐心 15、西横道有行人耐心 19。模型选择先放车,计划「next cycle serve critical EAST B_TO_A / WEST A_TO_B pedestrians once E-W exit crosswalks clear」。同批的 V00087(W_S2)在 tick 176 撞上闯红灯的行人(INC0001)。
- c37 t235:放行闯红灯风险车时漏判西横道。 战术摘要「Legalize S_L1 red-light threats V00040/V00067 (path clear of NORTH/EAST jaywalkers; west exit estimated ok)」。S_L1_LEFT 经过南、西横道,而西横道有两名行人耐心只剩 14 和 22。tick 255,V00067 在西横道撞伤行人(INC0006),到局终都没关闭。
- c14 t162:把尾随者一起放进去。 N_R1 top-3 里包括尾随者 V00107(战术摘要原话:「2 emergency + tailgater V00107」),而西横道有一名行人耐心只剩 8。tick 179,V00107 在西横道撞人(INC0002)。
- tick 210–261 放行变慢。 16 个周期放行 22 辆车,9 个周期 hold,上游积压 42.54,占全局积压罚款的 83%。
3. 损失链条
特情处理成熟 + 大波次放行 → 前 114 拍放行 87 辆车,几乎无损失
↓
tick 150 后行人耐心陆续告急,模型选择"先放车、下周期再放行人"
↓
后半局横道判断变差(错误率从 3.6% 升到 14%)+ 1 次 unverified 提交
↓
6 名行人受伤(罚 30),其中 3 人来自 c25 一次提交
↓
后段谨慎 hold,上游积压 42.54 + 终局 409 辆未服务(负债 194.1)
与 search baseline 的 48 分差距,主要来自撞人(多罚 20)和后段积压与未服务负债(合计多约 14)。
4. 评测局限
- 规则版本 16 的环境限制。 系统提示里没有路线-横道规则;横道上看不到未来车辆预约;不接受短键别名(v17–v18 才修复)。行人奖励要等行人走完全程才结算,所以这一局和两个 baseline 的行人奖励都是 0(v19 修复)。v16 观测未压缩,prompt 平均 25k token,与 v17 之后的结果不能直接比较 token 用量。
- 仍存在的引擎问题。 闯红灯检查只把"本拍在动"的车当作威胁;已在路口内的车不会为事故刹车,试算也只检查当前的锁。这两点会放大事故损失。
- 统计口径是启发式的。 注意力、横道断言和矛盾检测靠正则匹配推理文本;事故成本按"锁格 × 严重度 × 开放时长"分摊;周期价值排序只用来挑选证据。
- 样本量。 三次取最好、单一种子。