← Back to Home

DeepSeek V4 Pro — Test report

DeepSeek V4 Pro 路口调度测试最终报告

结论摘要

DeepSeek V4 Pro 有效运行得分 740.17。它比 balanced baseline(674.49)高 65.68,比 search baseline(788.38)低 48.21。三次运行的均值为 705.46,标准差 24.56,是四个模型里最稳定的。最大的优点是"会算账、会处理特情":整局锁格扣费只有 5.38,所有 10 次抛锚都在 1–10 拍内派出拖车,6 起事故都在 1 拍内下了清障令。行人处理在四个模型里也最好,合法放行 21 名行人。最大的问题仍是行人碰撞:6 名伤员共罚 30,而且最后 52 拍放行速度下降,上游积压罚款达 42.54。

  1. 特情处理最成熟。 整局用了 11 种工具,只有车道引导没用过,抛锚平均 4.2 拍内派拖车。
  2. 行人博弈最好但仍不够。 61 次行人相位尝试中 10 次成功,合法放行 21 人。但在行人耐心告急时仍放行了 80 车次经过该横道的车辆,最终 6 人受伤。
  3. 路线-横道判断前半局准、后半局变差。 前半局 84 条断言只错 3 条,后半局 157 条错了 22 条,整局正确率 89.6%。错误集中在混乱的后半局,并直接导致 c25 一次连伤 3 名行人。

0. 分数与稳定性

排名运行最终余额放行车辆事故API 调用工具成功率行人相位成功/尝试横道断言正确率
1152631644-43700740.17129616172.4%10/6189.6%
2114857334-103796689.28107520673.5%8/5976.2%
3124426092-121024686.92122421279.2%8/6575.8%

均值 705.46,最低 686.92,标准差 24.56。三次都高于 balanced baseline,说明稳定发挥在 baseline 之上。最好的一次比另外两次高约 52 分,差距主要在锁格扣费:最佳一局只有 5.38,另外两局分别是 34.70 和 53.60(第三局还有 20 的校车罚款)。

策略最终余额放行车辆未服务负债事故锁格扣费上游积压撞人闯红灯罚校车拖车
deepseek-v4-pro740.17129194.165.3851.52303.7012.0
baseline-balanced674.4984219.6621.3058.85255.508.4
baseline-search788.38122185.423.6945.85106.708.4

余额拆解:起始 1000,局内累计变化 −67.18,终局通行费 +1.46,未服务负债 −194.1(还有 409 辆车没服务完),合计 740.17。

时间段周期数放行车辆局内余额变化上游积压撞人
tick 61–140862−8.811.680
tick 140–175825+1.613.990
tick 175–2101220−15.783.3225
tick 210–2611622−44.2042.545

相对 search baseline 的 48 分差距里,撞人多罚 20,上游积压多 5.7,未服务负债多 8.7,拖车多 3.6。

1. 基础分析

1.1 上下文能力

指标数值
每次请求 prompt tokens平均 25,831,P95 50,035,最大 56,797(v16 观测未压缩)
每次回复推理 tokens平均 7,764,P95 25,551,最大 40,487
每周期 API 轮数平均 3.7,最多 7(上限 8)
工具参数里的 ID469 个,100% 能在当轮上下文中找到
非规范 ID / 重复失败调用0 / 0
working memory1 次,因超过 160 字符被拒

判读:在平均 25k、最长 57k token 的上下文中,ID 引用零错误。模型较多引用跨周期信息:recentCycles 关注率 0.93,lastSettlement 0.74。代价是推理极长,平均每次回复 2.8 万字符,自我修正标记 4,093 次(平均每次 25.4 个)。

1.2 注意力分布

v16 的观测里没有车道矩阵、出口和 reservedUntil 等字段(v17 才引入),这些概念不参与统计。

关注较多(≥0.95)关注中等(0.75–0.95)关注较少
停止线候选、横道、候选冲突、行人预警、紧急车、抛锚、时间预算(均为 1.0);hold 0.97;正在放行车道 0.96司机预警 0.94、上周期回顾 0.93、在路口车辆 0.93、被撤销放行 0.91、车道引导机会 0.89上次结算 0.74
唤醒原因次数有响应响应率
ACCIDENT_INTERRUPT771.00
VEHICLE_RED_LIGHT111.00
PEDESTRIAN_PATIENCE20150.75
PEDESTRIAN_JAYWALK740.57

判读:注意力分布很均衡,行人耐心中断的响应率 0.75,是四个模型中最高的。对在路口行驶车辆的关注率 0.93,也是四个模型中最高的,这与它很少出现连环事故是一致的。

1.3 tool_call 准确性

整体 221 次调用,成功率 72.4%;35 次回复并行发出多个工具调用,最多一次 6 个。

工具调用成功率说明
dry_run_admit9035.6%资源冲突 42、额度用完 11、车道头未就绪 3、规划视野超限 2、超过 16 车上限 1
commit_schedule4497.7%—
inspect_crosswalk / inspect_incident / inspect_lane_queue23 / 21 / 12100%用检查工具补全信息
order_accident_clearance / dispatch_tow_truck / set_lane_detour / reroute_queue_around_stall12 / 10 / 5 / 2100%—
dispatch_emergency_convoy10%c26 对 V00137 调用,返回 NOT_LANE_HEAD
manage_working_memory10%计划超过 160 字符

判读:试算成功率低,主要因为它大量把行人相位和车辆放在一起试算,冲突多是"真实冲突",不是格式错误。格式错误只有 1 次。

1.4 Agent 能力

指标数值
先试算再提交100%(所有有提交的周期)
提交构成verified 20、unverified 6、hold 18
每周期放行车数平均 2.9,最多 16
速度档位全部 CRUISE(40 次)
sleep_ticks10 拍 15 次,5 拍和 8 拍各 7 次
决策开销API 161 次扣 3.22,非终结工具 177 次扣 0.27

判读:流程纪律是满分,每次提交前都试算过。周期数只有 44 个(四个模型中最少),靠大波次和较长的睡眠节省决策开销。缺点是从不用 BURST,也没用过车道引导。

2. 进阶分析

2.1 逻辑推理

  1. 横道几何前准后差。 241 条断言正确率 89.6%。错误样例:
    • c12:「S_R1_RIGHT which doesn't cross E」(实际经过南、东横道)。
    • c22:「E_R1_RIGHT (if we admit, east right = south, crosses SOUTH」(实际经过东、北横道,模型把右转方向弄反了)。
    • c24:「N_R1_RIGHT eastbound should cross EAST」(实际经过北、西横道)。
  2. 会推理司机行为。 c37 t235 的推理:「If V00040 runs red while W_S1/W_S2 are admitted, collision! … So we MUST either admit V00040 (to legalize it) or ensure it can't run」。它准确预判了停在左转停止线、耐心为 0 的车会闯红灯,于是主动放行它们,把违规变成合法通行。思路正确,但执行时漏判了西横道(见 2.4 第 3 条)。
  3. 纠错效率中等。 试算失败(不含额度用完)47 次,再试 25 次,成功 10 次(40%);失败所在周期 32 次最终 hold。
  4. "说安全却冲突" 27 次,例如 c13 t153,推理「So no conflict with EAST crosswalk」,试算却撞上 CROSSWALK:EAST:CELL:6:0 vs V00043。v16 横道看不到未来车辆预约,这类错误有一部分是环境造成的。

2.2 复杂环境博弈

行人。 61 次相位尝试,10 次成功,共 7 批合法放行 21 人:

闯红灯只有 7 人,是四个模型中最少的。但 80 车次"耐心告急时放行经过该横道的车辆"仍然导致 6 人受伤,其中 4 人被撞前就在告急预警里。

事故。 6 起都是撞行人的 SERIOUS 侧撞。只有 INC0005 卷入两辆车,因为闯红灯的 V00095 追了上来,其余 5 起都是单车。没有发生连环事故,首次响应全在发生后 1 拍内:

事故发生车辆 / 路线放行周期关闭
INC0001176V00087 / W_S2_STRAIGHTc12193
INC0002179V00107 / N_R1_RIGHT(尾随者)c14194
INC0003195V00098 / E_L1_LEFTc25210
INC0004198V00149 / E_S1_STRAIGHTc25213
INC0005199V00129 / W_R1_RIGHT + 闯红灯 V00095c25216
INC0006255V00067 / S_L1_LEFTc37局终

抢行司机。 V00095(激进型)在 14 个周期里都出现在司机预警里。c12 模型把它放进 W_S2 top-4("includes tailgate V00095"),但 tick 166 因前方有闯红灯行人被撤销放行;tick 199 它自己闯红灯,卷入 INC0005。

紧急车辆与抛锚。 10 次抛锚的派车延迟为 1–10 拍,是四个模型中最快的。紧急车 V00050 和 V00137 分别等了 104 和 105 拍,唯一一次紧急车队调用失败了(c26,NOT_LANE_HEAD),之后没有再试。

2.3 亮眼操作

  1. c2 t71:一个周期处理抛锚并放行 12 辆车。 同时调用 dispatch_tow_truck(V00014)、reroute_queue_around_stall(V00074 绕开 V00014),再试算一次就通过,放行北向直行、东向和 S_S1 共 12 辆车,全部 verified,无一出事。
  2. c5 t96:东西直行 14 车波次。 战术摘要:「Run E-W straight wave (E_S1,E_S2,W_S1,W_S2) 14 vehicles ~18.2 reward」,试算一次通过。
  3. c41 t244:西横道双向放行 6 名行人,是四个模型中单批放行行人最多的一次。
  4. c43 t256:利用终局规则。 先检查事故、下令清障 INC0006,再放行 16 辆车,推理写道「Committed verified straight-lane batches … to move heads past stopline before endTick; tailgate risks enter after endTick so inert」。它理解了只剩 5 拍时,后续车辆的尾随风险已经不会兑现。
  5. 抛锚处理模板化。 10 次抛锚平均 4.2 拍派拖车,c10 t142 还对 V00089 同时派拖车并让 V00110、V00117 绕行。

2.4 最差操作

  1. c25 t195:一次 unverified 提交导致 3 起撞人事故。 观测里西横道两名行人耐心只剩 4 和 5,南横道剩 10。模型写道「Dropped NORTH-crossing lanes … admitted safe E_L1/E_S1/W_R1」。但 E_L1 经过东、南横道,E_S1 经过东、西横道,W_R1 经过西、南横道,三条"安全"路线全部经过告急横道。最终的提交也与试算结果不一致。tick 195–199 先后发生 INC0003、INC0004、INC0005,3 名行人受伤,估算成本约 18。
  2. c12 t151:东西直行波次撞上东横道行人。 当时东横道有行人耐心 15、西横道有行人耐心 19。模型选择先放车,计划「next cycle serve critical EAST B_TO_A / WEST A_TO_B pedestrians once E-W exit crosswalks clear」。同批的 V00087(W_S2)在 tick 176 撞上闯红灯的行人(INC0001)。
  3. c37 t235:放行闯红灯风险车时漏判西横道。 战术摘要「Legalize S_L1 red-light threats V00040/V00067 (path clear of NORTH/EAST jaywalkers; west exit estimated ok)」。S_L1_LEFT 经过南、西横道,而西横道有两名行人耐心只剩 14 和 22。tick 255,V00067 在西横道撞伤行人(INC0006),到局终都没关闭。
  4. c14 t162:把尾随者一起放进去。 N_R1 top-3 里包括尾随者 V00107(战术摘要原话:「2 emergency + tailgater V00107」),而西横道有一名行人耐心只剩 8。tick 179,V00107 在西横道撞人(INC0002)。
  5. tick 210–261 放行变慢。 16 个周期放行 22 辆车,9 个周期 hold,上游积压 42.54,占全局积压罚款的 83%。

3. 损失链条

特情处理成熟 + 大波次放行 → 前 114 拍放行 87 辆车,几乎无损失
        ↓
tick 150 后行人耐心陆续告急,模型选择"先放车、下周期再放行人"
        ↓
后半局横道判断变差(错误率从 3.6% 升到 14%)+ 1 次 unverified 提交
        ↓
6 名行人受伤(罚 30),其中 3 人来自 c25 一次提交
        ↓
后段谨慎 hold,上游积压 42.54 + 终局 409 辆未服务(负债 194.1)

与 search baseline 的 48 分差距,主要来自撞人(多罚 20)和后段积压与未服务负债(合计多约 14)。

4. 评测局限

  1. 规则版本 16 的环境限制。 系统提示里没有路线-横道规则;横道上看不到未来车辆预约;不接受短键别名(v17–v18 才修复)。行人奖励要等行人走完全程才结算,所以这一局和两个 baseline 的行人奖励都是 0(v19 修复)。v16 观测未压缩,prompt 平均 25k token,与 v17 之后的结果不能直接比较 token 用量。
  2. 仍存在的引擎问题。 闯红灯检查只把"本拍在动"的车当作威胁;已在路口内的车不会为事故刹车,试算也只检查当前的锁。这两点会放大事故损失。
  3. 统计口径是启发式的。 注意力、横道断言和矛盾检测靠正则匹配推理文本;事故成本按"锁格 × 严重度 × 开放时长"分摊;周期价值排序只用来挑选证据。
  4. 样本量。 三次取最好、单一种子。