每小时几条,看懂 AI 行业正在发生什么
本站每小时扫描全网热点,由 AI 筛出 AI 行业动态写成简短快讯,每天早上汇总为一份晨报。所有 AI 内容均有标注,并附原始来源。
最新文章
全部专栏
AI 词典幻觉(Hallucination):它不是「说谎」,是概率机器的必然副产品
一句话定义:幻觉(Hallucination)指大语言模型生成读起来通顺、格式漂亮,但内容与事实不符、或干脆是凭空捏造的输出——重点是,模型并不知道自己在编。 原理:一台只会算「下一句最像什么」的机器 模型本质上是一个逐
AI 词典测试时计算(Test-time Compute):让模型多想一会儿,代价是什么
一句话定义 测试时计算(Testtime Compute)指模型训练完成之后,在每次回答具体问题时额外投入的算力——让模型多想一会儿、多试几次,而不是只靠训练时把知识压进参数里。 它为什么有用 过去提升模型能力,主要靠训
AI 词典沙箱(Sandbox):让 AI 跑代码,但烧不到你的机器
一句话定义 沙箱(Sandbox)是一种把程序关进受限环境里运行的隔离机制:代码该跑还是跑,但它只能碰到你明确允许它碰的东西,越界就失败。 为什么需要它 大模型写代码这件事,现在已经很顺手了。真正麻烦的是下一步——把代码
AI 词典智能体记忆(Agent Memory):短期、长期、向量到底怎么分
一句话定义 智能体记忆(Agent Memory)是智能体(Agent)把交互中产生的信息存下来、需要时再取回来的能力,让它在多轮甚至跨会话的协作中不必每次从零开始。 打个比方 把智能体想成一个新来的助理。 开会时他桌上
AI 词典多智能体编排(Multi-Agent Orchestration):一群 Agent 开会,真比一个 Agent 干得好吗
一句话定义:多智能体编排(MultiAgent Orchestration)是指把多个 AI 智能体(Agent)组织成一支有分工、有流程、有交接规则的“团队”,由调度层决定谁在什么时候做什么、结果怎么汇总。 为什么不用
AI 词典ReAct:边想边做、边做边想的智能体循环
一句话定义 ReAct(Reasoning + Acting)是一种让大模型智能体把“推理”和“行动”交替进行的工作方式:模型先想一步,再调用工具或执行动作,拿到结果后继续想,直到完成任务。 它怎么运作 典型循环是 Th
AI 词典MCP(模型上下文协议):AI 世界的 USB-C 接口
一句话定义:MCP(Model Context Protocol,模型上下文协议)是一套开放标准,规定了「大模型如何统一地连接外部工具、数据源和系统」。 它到底解决什么问题 假设你想让 AI 助手查公司数据库。过去得为这
AI 词典函数调用(Function Calling):模型不执行代码,它只负责填单子
一句话定义 函数调用(Function Calling)指大语言模型(Large Language Model, LLM)在回答时,不直接执行任何代码,而是输出一段结构化的“调用申请”:要调用哪个函数、参数是什么。真正执
AI 词典流式输出(Streaming / SSE):打字机效果背后,服务端如何把字一个个推给你
一句话定义:流式输出(Streaming)是指服务端不等全部结果算完,就把已经生成的内容分片、持续推给客户端;SSE(ServerSent Events,服务器发送事件)是其中最常见的服务端推送协议。 把它想成上菜:普通
AI 词典分组查询注意力(GQA):为什么现在几乎所有开源模型配置里都写着它
一句话定义 分组查询注意力(GroupedQuery Attention,GQA) 是一种注意力机制的折中设计:把多个 Query 头分成若干组,每组共用同一份 Key 和 Value,从而在几乎不损失效果的前提下,把推
AI 词典FlashAttention:让注意力更快,靠的不是少算,而是少搬
一句话:FlashAttention 是一种「省着用显存带宽」的注意力(attention)计算方法——它算的东西和标准注意力一模一样,只是坚决不把中间那张巨大的矩阵搬进搬出显存。 原理:慢的原因往往不是算得慢,而是搬得
AI 词典投机解码(Speculative Decoding):小模型打草稿,大模型来验收
一句话:投机解码(Speculative Decoding)是让小模型先猜、大模型再验的大模型推理加速方法,在不改变目标模型输出分布的前提下降低生成延迟。 为什么能加速 大语言模型生成文本是自回归的:每吐一个字,都要把整
AI 词典连续批处理(Continuous Batching):让推理服务吞吐翻倍的关键调度技巧
一句话定义:连续批处理(Continuous Batching)是一种 LLM 推理调度策略:每个解码步都重新看一遍批次,谁生成完了就退出,排队的新请求立刻补位,而不是等整批全部结束才换下一批。 原理:LLM 生成文本分
AI 词典预填充与解码(Prefill / Decode):为什么 AI 答第一句最慢,后面却飞快
一句话定义:预填充(Prefill)是大模型一次性把整段提示词读完、并算出第一个字的阶段;解码(Decode)是之后一个字一个字往外蹦的阶段。 原理:批发和零售 大模型生成回答分两步走。 第一步 Prefill:你把提示
AI 词典KV Cache:为什么聊天越久,显存越吃紧
一句话定义 KV Cache(KeyValue Cache,键值缓存)是大模型逐 token(词元)生成文本时,把历史 token 在每层 selfattention(自注意力)中算过的 Key 和 Value 存下来,