跳到主内容
快讯直播
AI智模界
AI 词典

布局到图像生成:给AI一张座位表

一句话定义:布局到图像生成(Layout-to-Image)指的是在文字提示之外,再给模型一份"空间布局"——用边界框(bounding box)、掩码(mask)或关键点(keypoint)说明"什么东西、出现在画面哪个位置、占多大面积"——模型按这份约束把图渲染出来。

打个比方

让一支乐队拍合影。纯文本提示就像你只说一句"来张有气势的乐队合照":谁站前排、吉他手在左还是右、鼓在哪,全靠摄影师自己发挥。换一次提示、点一次生成,构图就变一次,想复现上一次的站位基本靠运气。

布局则像你递过去一张座位表:主唱居中偏左、占画面三分之一;鼓手在右下角;吉他手在左侧竖构图。摄影师不用再猜位置,只需要把每个人的表情、衣着、光影画好。

它到底是怎么"约束"的

主流做法是在扩散模型(diffusion model)里额外注入一路条件信号。具体形式通常是:把每个框或掩码转成一张和生成图同尺寸的空间图(spatial map),比如按类别上色的语义掩码(semantic mask),或者以物体中心向外衰减的高斯热力图。

这张空间图随后通过几种常见方式接入:和噪声图在通道维拼接、作为交叉注意力(cross-attention)的偏置去影响每个像素"听哪段文字"、或走一条额外的条件分支网络(类似 AI 词典:ControlNet">ControlNet 那类旁路结构)。采样过程中每个像素的生成都被这张图牵着走,所以物体不容易跑位。

和相邻概念的区别

概念你给模型什么位置从哪来
文生图(Text-to-Image)只有文字模型自己猜,每次可能不同
布局到图像生成文字 + 框/掩码/关键点你显式声明
局部重绘(Inpainting)已有图 + 要改的区域掩码表示"这里可以动",不规定改成什么
边缘/深度/姿态控制从参考图提取的结构图结构来自已有图片

关键差别:边缘图、深度图是"从已有图片里提取结构",布局是"凭空空降一份结构"。前者更像描摹,后者更像搭积木,自由度更高,也更抽象。

对从业者意味着什么

对设计和电商场景最直接:主图要求"产品居中、logo 右上角、模特在左三分之一",这种版式用纯提示词反复抽卡非常低效,布局能一次说清。做漫画分镜、游戏素材、海报批量出图也是同理。

对算法工程师,布局还有一个隐藏福利:布局本身就是标注。想给检测或分割模型造合成训练数据,直接拿框生成图,框和物体天然对齐,不用再人工标一遍。

局限也要清楚:布局只管"在哪里",不管"长什么样"和"细节对不对";框一多容易互相打架,小物体常常糊掉;布局和提示词冲突时还得调权重。至于各家工具支持哪些输入格式、参数怎么配,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。