一句话定义:占用网络(Occupancy Network)是一种把周围三维空间切成无数小方块,并逐个判断“这一格有没有东西”的感知模型。它输出的是几何占用情况,而不是一堆贴着类别的 3D 检测框。
原理:把世界切成乐高
想象你面前有一块大蛋糕,你想知道它内部是什么形状。最笨但最可靠的办法,是把它切成规则的小立方块,然后挨个尝一口:这格是实心的,那格是空的。占用网络做的就是这件事。它把车辆周围的空间划分成规则的三维网格,每个小格子叫一个体素(voxel)。模型接收摄像头、激光雷达(LiDAR)等传感器的输入,把二维图像特征“反投影”回三维空间,最后为每个体素输出一个概率:被占据,还是空的。
更进一步的做法叫语义占用(Semantic Occupancy):不只回答“有没有”,还回答“是什么”——是路面、是车辆,还是一堆散落的纸箱。
和 3D 检测框的区别
传统感知走的是“检测框”路线:先定义好人、车、自行车等类别,标注员给每个目标套一个 3D 长方体(3D bounding box),模型学着把框回归出来。这条路在标准物体上很准,但现实总有意外:侧翻的卡车、掉在路上的沙发、堆成一片的施工锥桶、伸进车道的树枝。它们要么形状奇怪,要么没被标注过,框套不上,就成了“幽灵障碍物”。
| 维度 | 3D 检测框 | 占用网络 |
|---|---|---|
| 表示形式 | 稀疏的立方体框 | 稠密的三维体素网格 |
| 输出内容 | 类别 + 位置尺寸朝向 | 每格的占据概率(可附语义) |
| 类别依赖 | 强,只认训练过的类别 | 弱,任何形状都表现为“被占” |
| 典型强项 | 标准车辆的精确跟踪 | 异形、未知、堆叠障碍物 |
| 主要代价 | 漏检未标注物体 | 算力与内存开销大,分辨率受限 |
也可以和 BEV(鸟瞰图)对比:BEV 是压扁到地面的二维视图,占用网络保留高度,能区分“桥下能过”和“桥上不能过”。
对从业者和普通人的意义
对做自动驾驶的人来说,占用网络的价值在于把“识别是什么”降级成“这里有没有东西”,从而绕开闭集类别的限制,给规划模块一个可以直接查询的地图:这条轨迹上的体素是不是空的?它天然适合纯视觉方案,因为不需要为每种奇怪物体准备标注框。代价是稠密计算很贵,通常要在分辨率、感知距离和实时性之间做取舍;远处的细小物体也可能被糊成一团。
对普通人来说,它意味着车辆更有可能看见“没被教过的东西”。但要提醒一句:占用网络不是万能护身符,它依然受限于传感器能看多远、模型训练覆盖了多少场景。具体车型用了什么方案、效果如何,以官方页面为准。
