LLMOps(大语言模型运维,Large Language Model Operations)指的是把大语言模型(Large Language Model, LLM)应用从"能跑通"推到"能稳定上线"的一整套工程实践:提示词、数据、评测、监控、回滚,都当成正经软件工程来管。
打个比方。早期做 AI 应用像在家里炒菜,厨师凭手感放盐,好吃就行。LLMOps 是把路边摊做成连锁餐厅:菜谱要写下来存档(提示词版本化),原料要留样溯源(数据与知识库管理),每道菜要有人试吃打分(评测),后厨装监控看火候(线上监控),万一某批菜咸了要能立刻换回上一版菜谱(回滚)。菜还是那道菜,区别在于出问题时你知道该翻哪本账。
为什么靠传统做法不够?因为模型输出是不确定的:同一个问题问两次,答案可能不同;换了模型版本、改了AI 词典:系统提示词">系统提示词、往知识库里塞了几十份新文档,效果都可能悄悄变差。没有这套流程的团队,往往靠"有人在群里说感觉最近不太行"来发现问题。
和相邻概念的区别:
| 概念 | 重心 | 与 LLMOps 的关系 |
|---|---|---|
| DevOps | 代码构建、部署、告警 | LLMOps 借用它的骨架 |
| MLOps | 训练数据、特征、模型训练与上线 | 关心"造模型",LLMOps 关心"用模型" |
| Prompt Engineering | 怎么写好一段提示词 | 是 LLMOps 的一个环节,像菜谱本身 |
| Agent 编排 | 多步骤任务调度 | LLMOps 的下游应用 |
LLMOps 日常改的是提示词、上下文和检索策略,而不是模型权重——这是它和 MLOps 最直观的差别。
对从业者来说,落地动作很具体:提示词进代码仓库,有版本号和评审;建一套小而准的回归测试集,每次改动先跑一遍;上线走灰度,看真实流量下的表现;把每次请求的输入输出留档,用户投诉某条回答时能查到当时喂给模型的原文;出问题能一键切回上一版配置。
对普通职场人,它的意义是:AI 功能不是接个接口就完事,答案质量需要流程来保障。想快速判断一个团队是否靠谱,可以问三个问题——提示词改坏了怎么退回上一版?怎么知道今天比上周差?用户投诉某条回答,能查到当时的输入吗?
具体工具与平台能力请以官方页面为准。
