跨语言迁移(Cross-lingual Transfer)指的是:模型在一种语言上学到的规律和能力,能直接搬到另一种语言上用,不必从零再学一遍。
打个比方。你在国内学会开车,去国外换成右舵车、靠左行驶,头几天别扭,但"看后视镜、控油门、预判车距"这些底层功夫照用不误。语言像左右舵和交通规则,能力才是驾驶技术。多语言模型也是这样长起来的:它把各种语言塞进同一套向量空间,"猫"和"cat"、"我很饿"和"I'm hungry"在空间里的位置彼此靠近。于是英文里学到的"先找条件、再列步骤、最后回查"这套推理路子,中文提问也能沾光——这就是迁移。
那为什么同一个模型英文答得漂亮,中文就掉档?多数时候不是模型没这个本事,而是数据配比的问题。预训练语料里英文往往占大头,中文见得太少,模型对中文的"路感"自然差。更隐蔽的一层是分词器(tokenizer):中文同一句话常被切成更多标记(token),既占AI 词典:上下文窗口">上下文窗口,也稀释了每个字拿到的学习信号。再加上模型内部常以英文为"思考语言",输出中文相当于多了一道转译,损耗层层叠加。
| 你看到的现象 | 常见原因 | 通常能做的事 |
|---|---|---|
| 英文流畅、中文生硬 | 中文预训练数据占比偏低 | 继续预训练、补中文语料 |
| 中文能答但推理乱 | 微调">指令微调(instruction tuning)阶段中文样本少 | 把中文指令数据放进微调集 |
| 中文长文容易触顶 | 分词器对中文效率不高 | 扩充词表,或按字预算留余量 |
和相邻概念的分工:多语言模型(multilingual model)说的是"这个模型会几种语言"这一配置;跨语言迁移说的是"学会一种、另一种跟着受益"这一效果。零样本跨语言迁移(zero-shot cross-lingual transfer)是它的特例——只在英文数据上微调,直接拿去跑中文。机器翻译(machine translation)则是把 A 语言转成 B 语言这个任务,跟能力复用不是一回事。
对从业者:评估多语言产品,别拿英文结果替中文背书,自己业务里用的语言得自己测;想让中文变好,中文数据就得进预训练和微调配比,指望"参数够大就自然会"通常落空。具体做法与支持语言列表以官方页面为准。对普通职场人:挑工具时按自己实际要用的语言试一轮,一个模型英文惊艳,不代表中文可靠,反过来也一样。
