BEV 感知(Bird's Eye View Perception)指的是:把车上多个摄像头(有时还加上激光雷达、毫米波雷达)看到的内容,统一变换到以自车为中心的俯视平面坐标系里,再在这个“上帝视角”上做检测、分割与预测。
为什么需要它
每个摄像头拍到的都是透视图像,近大远小。画面里两个物体像素挨得很近,真实距离可能差着好几米;一个被前车挡住的物体,在这台相机里干脆消失了。单看任何一张图,都很难回答“它在我左前方几米、会不会切进我的车道”这类问题。
BEV 的做法,是先估计图像中每个像素对应的深度,或者直接学一个从图像特征到俯视平面的变换,把特征“拍”到地面上摊平,拼成一张带网格的俯视图。打个比方:几个人围着餐桌从不同角度拍照,单看一张照片,很难判断谁挨着谁;把照片按相机位置贴到桌面平面图上,谁在左、谁在右、隔多远,一目了然。BEV 就是这么一张“桌面地图”,每个格子里存着位置、速度、障碍物类别、可行驶区域等特征,下游的规划模块可以直接在这张图上找路。
和相邻概念的区别
它和传统“后融合”不同:后融合是每个传感器各自算出一串目标,再把结果列表做匹配拼接,容易出现重复框、坐标对不齐;BEV 是在特征层就把多视角对齐到同一坐标系。它也和占用栅格(Occupancy Grid)有区别:占用栅格更关心每个空间格子有没有被占据,BEV 通常还保留目标框、车道线这类结构化输出,两者常配合使用。
| 维度 | 单目图像感知 | BEV 感知 |
|---|---|---|
| 坐标空间 | 图像平面(像素) | 自车俯视平面(米) |
| 距离估计 | 依赖假设或学习 | 在统一几何空间中给出 |
| 多传感器融合 | 结果层拼接 | 特征层对齐 |
| 下游规划 | 需再做坐标转换 | 可直接使用 |
对从业者和普通人的意义
对从业者来说,BEV 是一种好用的中间表示:多相机、多模态在同一个空间里对齐,时序上把过去几帧的 BEV 特征叠起来,还能更稳地估计速度、缓解遮挡带来的抖动。对普通人来说,它让自动泊车、高速辅助驾驶在近距离加塞、路口汇流时判断更稳。但要注意,BEV 的精度依赖相机标定与时间同步:标定漂了、帧不同步,拼出来的俯视图就会“错位”,因此系统通常会有降级策略,具体功能边界以官方页面为准。
