跳到主内容
快讯直播
AI智模界

每小时几条,看懂 AI 行业正在发生什么

本站每小时扫描全网热点,由 AI 筛出 AI 行业动态写成简短快讯,每天早上汇总为一份晨报。所有 AI 内容均有标注,并附原始来源。

最新文章

全部专栏
  1. AI 词典

    幻觉(Hallucination):它不是「说谎」,是概率机器的必然副产品

    一句话定义:幻觉(Hallucination)指大语言模型生成读起来通顺、格式漂亮,但内容与事实不符、或干脆是凭空捏造的输出——重点是,模型并不知道自己在编。 原理:一台只会算「下一句最像什么」的机器 模型本质上是一个逐

  2. AI 词典

    测试时计算(Test-time Compute):让模型多想一会儿,代价是什么

    一句话定义 测试时计算(Testtime Compute)指模型训练完成之后,在每次回答具体问题时额外投入的算力——让模型多想一会儿、多试几次,而不是只靠训练时把知识压进参数里。 它为什么有用 过去提升模型能力,主要靠训

  3. AI 词典

    沙箱(Sandbox):让 AI 跑代码,但烧不到你的机器

    一句话定义 沙箱(Sandbox)是一种把程序关进受限环境里运行的隔离机制:代码该跑还是跑,但它只能碰到你明确允许它碰的东西,越界就失败。 为什么需要它 大模型写代码这件事,现在已经很顺手了。真正麻烦的是下一步——把代码

  4. AI 词典

    智能体记忆(Agent Memory):短期、长期、向量到底怎么分

    一句话定义 智能体记忆(Agent Memory)是智能体(Agent)把交互中产生的信息存下来、需要时再取回来的能力,让它在多轮甚至跨会话的协作中不必每次从零开始。 打个比方 把智能体想成一个新来的助理。 开会时他桌上

  5. AI 词典

    多智能体编排(Multi-Agent Orchestration):一群 Agent 开会,真比一个 Agent 干得好吗

    一句话定义:多智能体编排(MultiAgent Orchestration)是指把多个 AI 智能体(Agent)组织成一支有分工、有流程、有交接规则的“团队”,由调度层决定谁在什么时候做什么、结果怎么汇总。 为什么不用

  6. AI 词典

    ReAct:边想边做、边做边想的智能体循环

    一句话定义 ReAct(Reasoning + Acting)是一种让大模型智能体把“推理”和“行动”交替进行的工作方式:模型先想一步,再调用工具或执行动作,拿到结果后继续想,直到完成任务。 它怎么运作 典型循环是 Th

  7. AI 词典

    MCP(模型上下文协议):AI 世界的 USB-C 接口

    一句话定义:MCP(Model Context Protocol,模型上下文协议)是一套开放标准,规定了「大模型如何统一地连接外部工具、数据源和系统」。 它到底解决什么问题 假设你想让 AI 助手查公司数据库。过去得为这

  8. AI 词典

    函数调用(Function Calling):模型不执行代码,它只负责填单子

    一句话定义 函数调用(Function Calling)指大语言模型(Large Language Model, LLM)在回答时,不直接执行任何代码,而是输出一段结构化的“调用申请”:要调用哪个函数、参数是什么。真正执

  9. AI 词典

    流式输出(Streaming / SSE):打字机效果背后,服务端如何把字一个个推给你

    一句话定义:流式输出(Streaming)是指服务端不等全部结果算完,就把已经生成的内容分片、持续推给客户端;SSE(ServerSent Events,服务器发送事件)是其中最常见的服务端推送协议。 把它想成上菜:普通

  10. AI 词典

    分组查询注意力(GQA):为什么现在几乎所有开源模型配置里都写着它

    一句话定义 分组查询注意力(GroupedQuery Attention,GQA) 是一种注意力机制的折中设计:把多个 Query 头分成若干组,每组共用同一份 Key 和 Value,从而在几乎不损失效果的前提下,把推

  11. AI 词典

    FlashAttention:让注意力更快,靠的不是少算,而是少搬

    一句话:FlashAttention 是一种「省着用显存带宽」的注意力(attention)计算方法——它算的东西和标准注意力一模一样,只是坚决不把中间那张巨大的矩阵搬进搬出显存。 原理:慢的原因往往不是算得慢,而是搬得

  12. AI 词典

    投机解码(Speculative Decoding):小模型打草稿,大模型来验收

    一句话:投机解码(Speculative Decoding)是让小模型先猜、大模型再验的大模型推理加速方法,在不改变目标模型输出分布的前提下降低生成延迟。 为什么能加速 大语言模型生成文本是自回归的:每吐一个字,都要把整

  13. AI 词典

    连续批处理(Continuous Batching):让推理服务吞吐翻倍的关键调度技巧

    一句话定义:连续批处理(Continuous Batching)是一种 LLM 推理调度策略:每个解码步都重新看一遍批次,谁生成完了就退出,排队的新请求立刻补位,而不是等整批全部结束才换下一批。 原理:LLM 生成文本分

  14. AI 词典

    预填充与解码(Prefill / Decode):为什么 AI 答第一句最慢,后面却飞快

    一句话定义:预填充(Prefill)是大模型一次性把整段提示词读完、并算出第一个字的阶段;解码(Decode)是之后一个字一个字往外蹦的阶段。 原理:批发和零售 大模型生成回答分两步走。 第一步 Prefill:你把提示

  15. AI 词典

    KV Cache:为什么聊天越久,显存越吃紧

    一句话定义 KV Cache(KeyValue Cache,键值缓存)是大模型逐 token(词元)生成文本时,把历史 token 在每层 selfattention(自注意力)中算过的 Key 和 Value 存下来,