一句话定义
内参(Intrinsics)说的是"这台相机怎么把三维世界压成二维像素",外参(Extrinsics)说的是"这台相机此刻被摆在世界的哪个位置、朝哪个方向"。
打个比方:用手机拍桌上的魔方
内参像镜头的"体质":是广角还是长焦、传感器多大、光轴打在画面的哪个点上。它跟魔方放哪儿没关系,同一台手机不换镜头、不变焦,内参基本不变。
外参像你举手机的那只手:站在桌子左边还是右边、俯拍还是平视。每挪一步、每转一次手腕,外参就换一组数。
具体长什么样
内参通常写成焦距 fx、fy(单位是像素,不是毫米)和主点 cx、cy,再加一组畸变系数,用来处理桶形或枕形变形。外参是旋转 R 加平移 t,合起来是个 3×4 矩阵,也叫相机位姿(pose)。
有了这两组数,图像上任意一个像素就能反向射出一条射线;多张照片的射线交会,就能三角化出三维点——这是 3D 重建、SLAM、新视角合成(比如高斯泼溅)共同的底座。
和邻近概念的区别
相机标定(calibration)求的通常是内参;位姿估计(pose estimation)求的是外参;SfM / SLAM 则三样一起求——内参、外参、三维点。
| 内参 Intrinsics | 外参 Extrinsics | |
|---|---|---|
| 描述 | 相机内部的成像几何 | 相机在世界中的位姿 |
| 典型参数 | fx, fy, cx, cy + 畸变系数 | 旋转 R、平移 t |
| 会不会变 | 同机同设置下基本稳定 | 每换个视角就变一次 |
| 常见任务 | 相机标定 | 位姿估计、轨迹追踪 |
为什么做世界模型绕不开它
视频里其实藏着内参和外参,只是没人写出来。纯 2D 监督下,模型很难自己把它俩拆开:一张图既可能是"长焦 + 远处",也可能是"广角 + 近处",这组歧义叫尺度/焦距模糊。所以做 3D 重建、自动驾驶、机器人导航时,常见做法是把内参外参显式喂进去,或者让模型额外预测出来,再拿去做几何对齐——否则前后两帧的深度和点云根本不在同一个坐标系里。
对从业者的实际意义
采数据时尽量保留标定文件,别只靠 EXIF;多视角要保证重叠和视差足够。用开源模型前,先看清它期望归一化内参还是像素内参。评估重建质量时先对齐坐标系,不然比较的其实是两套坐标。至于普通人,手机全景、AR 贴纸、扫描房间,背后都在实时算这两组数——只是没人告诉你而已。具体工具与数据格式请以官方文档为准。
