跳到主内容
快讯直播
AI智模界
AI 词典

BEV 感知:把多个摄像头拼成一张鸟瞰图

BEV 感知(Bird's Eye View Perception)指的是:把车上多个摄像头(有时还加上激光雷达、毫米波雷达)看到的内容,统一变换到以自车为中心的俯视平面坐标系里,再在这个“上帝视角”上做检测、分割与预测。

为什么需要它

每个摄像头拍到的都是透视图像,近大远小。画面里两个物体像素挨得很近,真实距离可能差着好几米;一个被前车挡住的物体,在这台相机里干脆消失了。单看任何一张图,都很难回答“它在我左前方几米、会不会切进我的车道”这类问题。

BEV 的做法,是先估计图像中每个像素对应的深度,或者直接学一个从图像特征到俯视平面的变换,把特征“拍”到地面上摊平,拼成一张带网格的俯视图。打个比方:几个人围着餐桌从不同角度拍照,单看一张照片,很难判断谁挨着谁;把照片按相机位置贴到桌面平面图上,谁在左、谁在右、隔多远,一目了然。BEV 就是这么一张“桌面地图”,每个格子里存着位置、速度、障碍物类别、可行驶区域等特征,下游的规划模块可以直接在这张图上找路。

和相邻概念的区别

它和传统“后融合”不同:后融合是每个传感器各自算出一串目标,再把结果列表做匹配拼接,容易出现重复框、坐标对不齐;BEV 是在特征层就把多视角对齐到同一坐标系。它也和占用栅格(Occupancy Grid)有区别:占用栅格更关心每个空间格子有没有被占据,BEV 通常还保留目标框、车道线这类结构化输出,两者常配合使用。

维度单目图像感知BEV 感知
坐标空间图像平面(像素)自车俯视平面(米)
距离估计依赖假设或学习在统一几何空间中给出
多传感器融合结果层拼接特征层对齐
下游规划需再做坐标转换可直接使用

对从业者和普通人的意义

对从业者来说,BEV 是一种好用的中间表示:多相机、多模态在同一个空间里对齐,时序上把过去几帧的 BEV 特征叠起来,还能更稳地估计速度、缓解遮挡带来的抖动。对普通人来说,它让自动泊车、高速辅助驾驶在近距离加塞、路口汇流时判断更稳。但要注意,BEV 的精度依赖相机标定与时间同步:标定漂了、帧不同步,拼出来的俯视图就会“错位”,因此系统通常会有降级策略,具体功能边界以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。