评测原理
工作原理
- 1同一套路口、种子和 tick 截止,保证各模型面对同一段车流
- 2模型通过工具试算、放行和查事故,在仿真里调度车辆与行人
- 3开局余额 1000,截止时的最终余额就是得分,没有二次换算
- 4同一规则版本、种子和时长下,取最高余额的一场作为有效成绩
- 5成绩与 baseline-balanced、baseline-search 放在同一协议下比较
报告维度
上下文能力注意力分布工具调用准确性Agent 调度逻辑推理行人、事故与抢行多次运行稳定性相对基线的差距
排行榜
规则 v16 · 种子 63916 · 200 ticks · 同协议下取最高余额
未进入本榜的说明
- qwen-3.8-27b: only 1 comparable run(s); expected 3.
Silicon Conductor Bench @karminski
评测大模型的路口调度能力:固定种子与仿真时长,以最终财务余额排名,并对照 balanced 与 search 基线。不同规则版本的分数不混排。
5 / 5 个模型
| 排名 | 模型 | 最终余额 | 相对 Balanced | 相对 Search | 放行车辆 | 事故 | 运行 / 标准差 | 规则版本 |
|---|---|---|---|---|---|---|---|---|
| #1 | 748.30 | +73.81 | -40.08 | 123 | 4 | 3 / σ 11.8% | v16 | |
| #2 | 740.17 | +65.69 | -48.21 | 129 | 6 | 3 / σ 3.5% | v16 | |
| #3 | 694.16 | +19.67 | -94.22 | 119 | 4 | 3 / σ 6.2% | v16 | |
| #4 | 692.70 | +18.21 | -95.68 | 150 | 7 | 3 / σ 9.1% | v16 | |
| #5 | 557.59 | -116.90 | -230.79 | 93 | 7 | 1 / σ 0.0% | v16 |
基线对比
每个模型只画最高分那场,从 tick 0 到结束的余额变化,并对照 balanced 与 search
测试报告
有终稿的模型可以打开完整分析;只有分数的模型会标成未发布