跳到主内容
快讯直播
AI智模界
AI 词典

特征工程与表示学习:人挑特征,还是机器自己学

一句话定义

特征工程(feature engineering)是人根据业务理解,把原始数据加工成模型能直接使用的输入;表示学习(representation learning)是把这一步交给模型,让它在训练过程中自己学出有用的输入表示。

为什么需要这一步

原始数据很少是模型能直接吃的。一份订单记录里有时间戳、商品 ID、金额、用户 ID,模型要判断这单是不是欺诈,得先有人把这些字段翻译成有意义的量:这笔金额比该用户历史均值高多少、下单距注册多久、同一设备当天登录过几个账号——这些才是"特征"。模型只认数字,不认业务。

打个比方:特征工程像自己下厨,食材要洗、切、配、调味,每一步都靠人的经验判断;表示学习像把整块食材丢给一台会自己琢磨的机器,它试出该怎么切、怎么配,最后端出的菜反而更对味。经典例子是图像识别:传统做法要人工设计边缘、角点、纹理算子;深度网络直接把像素喂进去,浅层自己学出边缘和色块,深层组合成眼睛、轮子、猫脸。

两者的关键差别

维度特征工程表示学习
谁定规则人,依赖领域知识模型,依赖数据和目标函数
数据量要求中小数据也能work通常需要大量数据
可解释性特征有明确业务含义表示是向量,含义模糊
迁移性换个场景往往要重做学到的表示常可迁移复用
人力成本高,且高度依赖专家前期低,后期转向调架构和评估

要注意,两者不是替代关系。深度学习里依然有大量人工设计:数据的清洗和采样、样本构造、位置编码、损失函数的选择,都属于广义的特征工程。真正被换掉的,是"手工把原始信号翻译成中间表示"这一块最费人力的活。

对从业者的意义

传统机器学习项目里,业界常说特征工程吃掉了大部分时间,模型选型反而是小头。表示学习把重心挪走了:从"我该造哪些特征"变成"我该喂什么数据、用什么结构、怎么评估学出来的表示好不好"。这对两类人影响不同——做表格类风控、定价的,手工特征依然是主力,因为业务规则本身就是强信号;做图像、语音、文本、推荐的,几乎全部转向表示学习加少量特征工程。

对普通人的意义

你能感知到的变化大多来自这里:搜索能理解"苹果"指的是水果还是公司,推荐能认出你刚看过的风格,语音助手在嘈杂环境也听得清。这些不是有人写了几万条规则,而是模型自己从海量数据里学出了表示。

想动手的话,不必一上来就上大模型:小数据集先老老实实做特征工程,往往比硬套复杂网络更划算;数据量上来后,再让模型自己去学。具体工具和框架的选择,以官方页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。