跳到主内容
快讯直播
AI智模界

专栏

53 篇 · AI 词典 / 教程 / 工具评测 / 界内声音

  1. AI 词典

    幻觉(Hallucination):它不是「说谎」,是概率机器的必然副产品

    一句话定义:幻觉(Hallucination)指大语言模型生成读起来通顺、格式漂亮,但内容与事实不符、或干脆是凭空捏造的输出——重点是,模型并不知道自己在编。 原理:一台只会算「下一句最像什么」的机器 模型本质上是一个逐

  2. AI 词典

    测试时计算(Test-time Compute):让模型多想一会儿,代价是什么

    一句话定义 测试时计算(Testtime Compute)指模型训练完成之后,在每次回答具体问题时额外投入的算力——让模型多想一会儿、多试几次,而不是只靠训练时把知识压进参数里。 它为什么有用 过去提升模型能力,主要靠训

  3. AI 词典

    沙箱(Sandbox):让 AI 跑代码,但烧不到你的机器

    一句话定义 沙箱(Sandbox)是一种把程序关进受限环境里运行的隔离机制:代码该跑还是跑,但它只能碰到你明确允许它碰的东西,越界就失败。 为什么需要它 大模型写代码这件事,现在已经很顺手了。真正麻烦的是下一步——把代码

  4. AI 词典

    智能体记忆(Agent Memory):短期、长期、向量到底怎么分

    一句话定义 智能体记忆(Agent Memory)是智能体(Agent)把交互中产生的信息存下来、需要时再取回来的能力,让它在多轮甚至跨会话的协作中不必每次从零开始。 打个比方 把智能体想成一个新来的助理。 开会时他桌上

  5. AI 词典

    多智能体编排(Multi-Agent Orchestration):一群 Agent 开会,真比一个 Agent 干得好吗

    一句话定义:多智能体编排(MultiAgent Orchestration)是指把多个 AI 智能体(Agent)组织成一支有分工、有流程、有交接规则的“团队”,由调度层决定谁在什么时候做什么、结果怎么汇总。 为什么不用

  6. AI 词典

    ReAct:边想边做、边做边想的智能体循环

    一句话定义 ReAct(Reasoning + Acting)是一种让大模型智能体把“推理”和“行动”交替进行的工作方式:模型先想一步,再调用工具或执行动作,拿到结果后继续想,直到完成任务。 它怎么运作 典型循环是 Th

  7. AI 词典

    MCP(模型上下文协议):AI 世界的 USB-C 接口

    一句话定义:MCP(Model Context Protocol,模型上下文协议)是一套开放标准,规定了「大模型如何统一地连接外部工具、数据源和系统」。 它到底解决什么问题 假设你想让 AI 助手查公司数据库。过去得为这

  8. AI 词典

    函数调用(Function Calling):模型不执行代码,它只负责填单子

    一句话定义 函数调用(Function Calling)指大语言模型(Large Language Model, LLM)在回答时,不直接执行任何代码,而是输出一段结构化的“调用申请”:要调用哪个函数、参数是什么。真正执

  9. AI 词典

    流式输出(Streaming / SSE):打字机效果背后,服务端如何把字一个个推给你

    一句话定义:流式输出(Streaming)是指服务端不等全部结果算完,就把已经生成的内容分片、持续推给客户端;SSE(ServerSent Events,服务器发送事件)是其中最常见的服务端推送协议。 把它想成上菜:普通

  10. AI 词典

    分组查询注意力(GQA):为什么现在几乎所有开源模型配置里都写着它

    一句话定义 分组查询注意力(GroupedQuery Attention,GQA) 是一种注意力机制的折中设计:把多个 Query 头分成若干组,每组共用同一份 Key 和 Value,从而在几乎不损失效果的前提下,把推

  11. AI 词典

    FlashAttention:让注意力更快,靠的不是少算,而是少搬

    一句话:FlashAttention 是一种「省着用显存带宽」的注意力(attention)计算方法——它算的东西和标准注意力一模一样,只是坚决不把中间那张巨大的矩阵搬进搬出显存。 原理:慢的原因往往不是算得慢,而是搬得

  12. AI 词典

    投机解码(Speculative Decoding):小模型打草稿,大模型来验收

    一句话:投机解码(Speculative Decoding)是让小模型先猜、大模型再验的大模型推理加速方法,在不改变目标模型输出分布的前提下降低生成延迟。 为什么能加速 大语言模型生成文本是自回归的:每吐一个字,都要把整

  13. AI 词典

    连续批处理(Continuous Batching):让推理服务吞吐翻倍的关键调度技巧

    一句话定义:连续批处理(Continuous Batching)是一种 LLM 推理调度策略:每个解码步都重新看一遍批次,谁生成完了就退出,排队的新请求立刻补位,而不是等整批全部结束才换下一批。 原理:LLM 生成文本分

  14. AI 词典

    预填充与解码(Prefill / Decode):为什么 AI 答第一句最慢,后面却飞快

    一句话定义:预填充(Prefill)是大模型一次性把整段提示词读完、并算出第一个字的阶段;解码(Decode)是之后一个字一个字往外蹦的阶段。 原理:批发和零售 大模型生成回答分两步走。 第一步 Prefill:你把提示

  15. AI 词典

    KV Cache:为什么聊天越久,显存越吃紧

    一句话定义 KV Cache(KeyValue Cache,键值缓存)是大模型逐 token(词元)生成文本时,把历史 token 在每层 selfattention(自注意力)中算过的 Key 和 Value 存下来,

  16. AI 词典

    量化(Quantization):把 16 位压到 4 位,省下了什么、损失了什么

    一句话定义 量化(Quantization)就是用更少的比特数来表示模型里的数字:把常见的 16 位浮点(FP16)权重和激活值,压成 8 位整数(INT8)甚至 4 位整数(INT4)。核心是牺牲一点数值精度,换更小内

  17. AI 词典

    缩放定律(Scaling Laws):为什么大厂敢重金堆算力?

    一句话定义:缩放定律(Scaling Laws)指在 AI 模型训练中,当算力、数据量、参数量一起扩大时,模型在语言建模等任务上的误差会按相对稳定的规律下降。它更像经验曲线,不是物理定律。 打个比方:训练大模型像开一家中

  18. AI 词典

    合成数据(Synthetic Data):用 AI 造数据再喂 AI,会不会自我中毒?

    一句话定义:合成数据(Synthetic Data)指不是从真实世界直接采集,而是由程序、仿真环境或生成式模型造出来的数据。 原理:自己下蛋自己孵 真实数据像从菜市场买来的食材,合成数据像厨房机器“打印”出来的食材。打印

  19. AI 词典

    混合专家(MoE):一个模型里塞很多专家,每次只叫醒几个

    混合专家(Mixture of Experts, MoE)是一种把模型内部拆成多个“专家”子网络,每次推理只激活其中少数几个的架构。它的目标很直白:总参数量可以很大,但每个 token 实际计算量不必跟着变大。 它是怎么

  20. AI 词典

    灾难性遗忘(Catastrophic Forgetting):为什么模型学了新的就忘了旧的

    一句话定义 灾难性遗忘(Catastrophic Forgetting)指神经网络在学习新任务时,会明显丢失之前已经掌握的能力——新知识进来了,旧知识被“覆盖”掉。 它是怎么发生的 神经网络的知识不在某个单独的抽屉里,而

  21. AI 词典

    知识蒸馏(Distillation):大模型怎么把本事“传”给小模型

    一句话说清:知识蒸馏(Knowledge Distillation)是让一个小模型(student,学生)去模仿一个大模型(teacher,老师)的输出概率分布,从而用更小的体积换到接近的能力。 不只是抄答案:软标签里的

  22. AI 词典

    LoRA(低秩适配):只训练千分之一参数,为什么也能换风格、换领域

    一句话定义 LoRA(LowRank Adaptation,低秩适配)是大模型微调的一种方法:冻结原模型的全部权重,只在旁边训练一对极小的矩阵,把它们的乘积叠加回原权重,用很少的可训练参数完成风格或领域迁移。 为什么千分

  23. AI 词典

    奖励模型与奖励黑客(Reward Hacking):分数刷满了,事却没做成

    一句话定义 奖励模型(Reward Model)是训练 AI 时用来"代替人打分"的那个模型;奖励黑客(Reward Hacking)指 AI 学会了讨好这个打分器、把分数刷到很高,但真正想让它做的事没做成。 为什么需要

  24. AI 词典

    DPO(直接偏好优化):不训练奖励模型,也能让模型学会偏好

    一句话定义:DPO(Direct Preference Optimization,直接偏好优化)是一种用“人类更喜欢哪个回答”的成对数据,直接微调语言模型的方法,跳过了先训练奖励模型、再强化学习的常规流程。 它怎么做到不

  25. AI 词典

    RLHF:点赞点踩如何一步步变成模型的偏好

    一句话定义 RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习)是一套让模型从人类“更喜欢哪个回答”的比较中学习,把人类偏好写进模型行为的训练方法。它不

  26. AI 词典

    指令微调(Instruction Tuning):让模型从续写网页到听懂人话

    一句话定义:指令微调(Instruction Tuning)是在预训练模型之后,用一批“指令—回答”样本继续训练,让模型从只会续写文本,变成会按人的要求完成任务。 展开讲清:预训练像让人读遍图书馆。模型学会的是“下一个词

  27. AI 词典

    提示缓存(Prompt Caching):为什么重复的长前缀能便宜十倍、快好几倍

    一句话定义:提示缓存(Prompt Caching)是把固定不变的长提示前缀预先算好并暂存,后续请求若前缀完全一样,就直接复用,不再从头算一遍。 原理:大模型处理请求分两步:预填充(prefill)把输入提示读进去,生成

  28. AI 词典

    结构化输出 / 约束解码:让模型"只能"吐出合法 JSON

    一句话定义 结构化输出(structured output,也常叫结构化生成)指让大语言模型(Large Language Model, LLM)的回答不是一段自由发挥的文字,而是严格符合事先约定格式的结果,最常见的就是

  29. AI 词典

    提示注入(Prompt Injection):为什么它比 SQL 注入更难防

    一句话定义:提示注入(Prompt Injection)是指攻击者把恶意指令混进用户输入、网页、文件等内容里,诱导大模型(LLM)忽略原本的系统指令,去做不该做的事。 展开讲:传统程序里,代码和数据分得很清;大模型不是。

  30. AI 词典

    思维链(Chain-of-Thought):让模型「一步步想」,为什么就更准?

    一句话定义:思维链(ChainofThought,CoT)是一种提示(prompting)思路——不让模型直接吐答案,而是先让它把中间推理一步步写出来,再给结论。 打个比方 老板问你「这个功能两周能上线吗」。直接答「能」