跳到主内容
快讯直播
AI智模界
AI 词典

占用网络:让车看见“没见过的障碍物”

一句话定义:占用网络(Occupancy Network)是一种把周围三维空间切成无数小方块,并逐个判断“这一格有没有东西”的感知模型。它输出的是几何占用情况,而不是一堆贴着类别的 3D 检测框。

原理:把世界切成乐高

想象你面前有一块大蛋糕,你想知道它内部是什么形状。最笨但最可靠的办法,是把它切成规则的小立方块,然后挨个尝一口:这格是实心的,那格是空的。占用网络做的就是这件事。它把车辆周围的空间划分成规则的三维网格,每个小格子叫一个体素(voxel)。模型接收摄像头、激光雷达(LiDAR)等传感器的输入,把二维图像特征“反投影”回三维空间,最后为每个体素输出一个概率:被占据,还是空的。

更进一步的做法叫语义占用(Semantic Occupancy):不只回答“有没有”,还回答“是什么”——是路面、是车辆,还是一堆散落的纸箱。

和 3D 检测框的区别

传统感知走的是“检测框”路线:先定义好人、车、自行车等类别,标注员给每个目标套一个 3D 长方体(3D bounding box),模型学着把框回归出来。这条路在标准物体上很准,但现实总有意外:侧翻的卡车、掉在路上的沙发、堆成一片的施工锥桶、伸进车道的树枝。它们要么形状奇怪,要么没被标注过,框套不上,就成了“幽灵障碍物”。

维度3D 检测框占用网络
表示形式稀疏的立方体框稠密的三维体素网格
输出内容类别 + 位置尺寸朝向每格的占据概率(可附语义)
类别依赖强,只认训练过的类别弱,任何形状都表现为“被占”
典型强项标准车辆的精确跟踪异形、未知、堆叠障碍物
主要代价漏检未标注物体算力与内存开销大,分辨率受限

也可以和 BEV(鸟瞰图)对比:BEV 是压扁到地面的二维视图,占用网络保留高度,能区分“桥下能过”和“桥上不能过”。

对从业者和普通人的意义

对做自动驾驶的人来说,占用网络的价值在于把“识别是什么”降级成“这里有没有东西”,从而绕开闭集类别的限制,给规划模块一个可以直接查询的地图:这条轨迹上的体素是不是空的?它天然适合纯视觉方案,因为不需要为每种奇怪物体准备标注框。代价是稠密计算很贵,通常要在分辨率、感知距离和实时性之间做取舍;远处的细小物体也可能被糊成一团。

对普通人来说,它意味着车辆更有可能看见“没被教过的东西”。但要提醒一句:占用网络不是万能护身符,它依然受限于传感器能看多远、模型训练覆盖了多少场景。具体车型用了什么方案、效果如何,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。