- 类型
- 论文
- 来源
- arXiv AI
- 发布
- 2026年9月30日 04:16
- 状态
- 单一信源
发生了什么
研究团队发布 DrivingBench,据其称为首个要求通用视觉语言模型驾驶真车的基准。模型通过三个工具读取 Toyota Corolla 的摄像头画面,并在低速锥桶场地直接控制转向与速度。车辆在模型推理期间仍可能移动,新指令会替换当前指令,因此推理延迟被纳入任务。GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Grok 4.6 各在原生 harness 中最多尝试三次,仅 Astra 在第二次尝试完成赛道,其余尝试均未通过 50%。
为什么重要
此前视觉语言模型的能力多由数字基准衡量,驾驶真车这类日常技能基本未被测试。该基准把延迟、持续运动和指令替换纳入同一长时程任务,并公开 harness、提示词、赛道图与含视频和遥测的轨迹,使真车闭环控制结果可复现、可比较。
底层逻辑
模型不直接输出底层控制信号,而是通过工具接口读取相机帧并下达转向与速度指令。由于车辆在推理期间继续运动,模型必须在不完整、滞后的观察下观察、行动、监控、恢复并完成长时程目标。同时,工具输出格式与任务表述方式被作者指出会直接决定模型是否愿意驾驶。
产品与商业机会
对做具身智能、辅助驾驶或机器人控制的产品团队,该基准提示接口格式与任务表述会显著影响模型是否行动,延迟必须作为任务变量而非事后优化项。团队可据此设计带上下文保留的多轮尝试流程,并为安全恢复和拒绝行为预留策略。
- 在机器人或车辆控制产品中,将指令接口设计列为独立测试项,比较不同工具输出格式对模型是否执行的影响。
- 为长时程控制任务增加延迟注入测试,验证模型在指令被替换时的监控与恢复能力。
- 复用 DrivingBench 公开的 harness、赛道图和遥测轨迹,建立内部回归测试以比较不同模型的完成率。
- 针对模型拒绝执行的问题,建立任务表述与提示模板的 A/B 测试,减少不必要的拒答。
仍待确认
- 基准发布时提到的模型版本是否已公开可用,其真实配置和调用方式如何?
- 除赛道完成率外,是否记录了碰撞、越界或其他安全相关指标?
- 四个模型中哪些在保留上下文的多轮尝试里出现明显改善,幅度如何?
- 该基准结果在更高速度或开放道路场景下是否仍然成立?