一句话定义:Data Agent(数据智能体)是能自主理解业务问题、规划步骤、调用数据库与工具、核对结果并给出结论的 AI 程序——它交付的不是一条 SQL,而是一个答案。
它到底多做了什么
传统 Text2SQL 像给数据仓库配了一台"翻译机":你用中文问一句,它翻成 SQL,跑出来一张表。问题在于,真实业务提问往往是模糊的、多步的:"上季度华东区哪些门店的复购在下滑,可能受什么影响?"——这需要先定义口径、拆解成若干查询、比对多张表、发现异常、再解释原因。
打个比方:数据仓库是一栋图书馆。BI 工具是墙上的电子报栏,展示的是别人提前排版好的固定栏目;Text2SQL 是给你一张检索卡,你得自己知道该查哪本书,一次只能查一次;而 Data Agent 更像一位懂业务的助理研究员——他先想清楚要查什么,跑几趟书库,发现某本书不在就换个索引,把资料交叉核对后,交给你一页结论。
技术上,它通常由几块拼成:对表结构和业务语义的理解(常借助语义层或元数据)、任务规划与拆解、工具调用(SQL 引擎、检索、代码执行)、执行结果的自我校验与重试,以及最终的自然语言生成。和只会"一问一答"的 Text2SQL 相比,核心差别是闭环:能感知错误、能多轮迭代、能对结果负责。
三者对比
| 维度 | BI 工具 | Text2SQL | Data Agent |
|---|---|---|---|
| 交互方式 | 拖拽、看固定看板 | 自然语言转一条查询 | 自然语言下任务,多步自主执行 |
| 能否处理模糊需求 | 不能,口径需预先建模 | 较弱,问题须足够明确 | 较强,会主动澄清与拆解 |
| 输出物 | 图表与看板 | SQL 与结果集 | 结论、解释,附带查询过程 |
| 出错时 | 依赖人工排查 | 报错即终止 | 可自我修正、重试、换路径 |
| 人的角色 | 建模者、看数者 | 提问者兼审阅者 | 提问者兼验收者 |
为什么数据库厂商也在押注
包括 OceanBase 在内的数据库厂商近年纷纷把 Data Agent 当作新方向,逻辑并不难懂。第一,数据就在库里,智能体离数据越近,延迟和搬运成本越低,权限与治理也更干净。第二,Text2SQL 的准确率长期卡在"看不懂业务口径"上,而语义层、优化器统计信息、血缘这些恰恰是数据库厂商手里的资产。第三,竞争维度在变:过去比的是存得快、查得快,现在多了一条"问得准"。第四,智能体的每一次规划都要反复读写数据库,它本身就是一种新的负载。
对从业者的意义
做数据的人,工作重心会从"写 SQL、做报表"往"定义口径、设计语义层、验收智能体输出"迁移——你更像规则的制定者而非取数工。做 AI 应用的人,则要意识到 Data Agent 的难点不在模型,而在数据质量、权限边界和可验证性。对普通职场人,最直接的变化是:以后问数不用再排队等分析师,但也必须习惯对 AI 给出的结论保留一分怀疑——口径对不对,仍然得有人负责。
具体产品的能力边界和可用范围,以各厂商官方页面为准。
