一句话定义:原生分辨率(Native Resolution)指的是一个图像生成模型在训练时反复见到的那几种画面尺寸和长宽比(Aspect Ratio),它划定了模型画得最稳、最不容易出怪图的安全区。
打个比方:这就像一个只做过三种版型西装的裁缝——1:1、4:3、16:9。你非要他裁一块 21:9 的极窄布料,他也能下剪刀,但肩线会歪、扣子会偏。扩散模型(AI 词典:Diffusion Model">Diffusion Model)同理:训练数据在送入网络前会被缩放、裁剪到若干固定尺寸,比如 512×512、768×768,或 832×1216 这类竖构图。模型在这些尺寸下学到的空间关系是"肌肉记忆",一旦你要求一个训练中很少出现的尺寸,它只能靠外推硬撑,结果往往是元素重复、人物肢体拉长、多手多脚、主体被切掉。
为什么会有安全区:训练时每个尺寸的出现频率不同,极端长宽比天然稀少,模型就没学好。分辨率高低本身也是同理——不是像素越多越好,而是"落在见过的区间里"才稳定。
和相邻概念的区别:
| 概念 | 说的是什么 |
|---|---|
| 训练分辨率 | 数据侧的客观事实:训练图被统一成了多大 |
| 原生分辨率 | 使用侧的说明书:在哪个尺寸区间内模型表现可靠 |
| 输出分辨率 | 你这次实际要了多大,可以超出原生区间,但通常靠放大或分块拼接实现 |
| 长宽比 | 形状(方、横、竖);分辨率是像素总量,两者是不同维度 |
同一个 1:1 比例,512×512 和 1024×1024 是两种分辨率、同一种长宽比。
对从业者的意义:选尺寸前先看模型卡(Model Card)或官方文档给出的推荐尺寸列表,尽量直接用列表里的值。需要别的比例时,先用最接近的原生比例出图,再裁切或向外扩展补边,比直接硬设极端宽高靠谱得多。
对普通职场人的意义:用文生图工具做海报、配图时,别随手把宽高拉到极端值。正方形和常规横竖构图最稳;想要超宽横幅,先出正常比例,再交给修图软件补边。分辨率调高不等于细节更好,跑出原生区间反而更容易崩。具体每个模型支持哪些尺寸,以官方页面为准。
