KCORES LLM Arena

Silicon Conductor Bench

硅基交警 | 大模型路口调度能力评测

让大模型作为路口临时指挥的交通警察,在固定种子和仿真时长内用工具指挥车辆与行人。测试大模型的 Agent 与决策博弈能力。 最终财务余额就是得分,并与内置调度基线对照。

评测原理

工作原理

  1. 1同一套路口、种子和 tick 截止,保证各模型面对同一段车流
  2. 2模型通过工具试算、放行和查事故,在仿真里调度车辆与行人
  3. 3开局余额 1000,截止时的最终余额就是得分,没有二次换算
  4. 4同一规则版本、种子和时长下,取最高余额的一场作为有效成绩
  5. 5成绩与 baseline-balanced、baseline-search 放在同一协议下比较

报告维度

上下文能力注意力分布工具调用准确性Agent 调度逻辑推理行人、事故与抢行多次运行稳定性相对基线的差距

排行榜

规则 v16 · 种子 63916 · 200 ticks · 同协议下取最高余额

未进入本榜的说明
  • qwen-3.8-27b: only 1 comparable run(s); expected 3.

Silicon Conductor Bench @karminski

评测大模型的路口调度能力:固定种子与仿真时长,以最终财务余额排名,并对照 balanced 与 search 基线。不同规则版本的分数不混排。

排名模型最终余额相对 Balanced相对 Search放行车辆事故运行 / 标准差规则版本
#1748.30+73.81-40.0812343 / σ 11.8%v16
#2740.17+65.69-48.2112963 / σ 3.5%v16
#3694.16+19.67-94.2211943 / σ 6.2%v16
#4692.70+18.21-95.6815073 / σ 9.1%v16
#5
Qwen 3.8 27B
557.59-116.90-230.799371 / σ 0.0%v16

基线对比

每个模型只画最高分那场,从 tick 0 到结束的余额变化,并对照 balanced 与 search

测试报告

有终稿的模型可以打开完整分析;只有分数的模型会标成未发布