一项题为「Training a 4B model to produce 81% faster query plans than Postgres」的工作(链接:rohanbansal.com/qorl,归类为论文)提出:用 40 亿参数规模的模型生成数据库查询计划,其产出计划的执行速度比 Postgres 快 81%。
发生了什么
按该工作的说法,核心是把查询计划生成交给一个 4B 模型,而非 Postgres 内置优化器,并在执行速度上取得 81% 的提升。目前公开的仅有这一结论性表述。81% 的统计口径(对比何种查询负载、何种硬件与数据规模、是平均值还是最优情况),以及是否已将模型推理耗时计入,均需查阅原文确认。
为什么重要
查询计划是数据库性能最直接的杠杆之一。传统优化器依赖代价模型与基数估计,在多表连接、复杂谓词和数据倾斜场景下容易估偏,从而选出次优计划,相关调优长期依赖人工经验。把这一环节交给模型,是被讨论多年但落地缓慢的路线,主要障碍在于推理开销可能吃掉执行收益,以及跨负载的泛化能力难以保证。
值得关注的点
4B 属于相对克制的规模。若 81% 的提升在计入推理成本后仍成立,"用模型增强甚至替代优化器"在成本上就开始具备现实性。对 AI 从业者而言,这也是模型能力落到系统级任务的样本:目标不是生成文本,而是产出可执行、可用执行时间直接衡量的工程决策。
同时,学习式优化器面对的经典质疑仍未消失——换一种数据分布或查询模式后是否依然成立。仅凭标题无法回答,这是后续需要核验的重点。
