跳到主内容
快讯直播
AI智模界
模型

Mercury 2.5 实测 770 tokens/秒,推理速度成关注焦点

据模型评测平台 Artificial Analysis 的模型页面显示,模型 Mercury 2.5 的实测输出速度达到 770 tokens/秒。该数字出现在 Artificial Analysis 的 Mercury 2.5 页面上,除此之外,暂无关于该模型参数规模、上下文长度、部署方式与定价的公开说明。

对 AI 从业者来说,这个数字之所以值得留意,在于输出速度正越来越直接地决定产品形态。一方面,交互式应用的体验高度依赖首 token 延迟与持续输出速率,数百 tokens/秒级别的生成速度,意味着原本需要十几秒甚至更久才能完成的回答,可以在数秒内呈现完毕。另一方面,Agent 类工作负载通常需要串联数十次甚至上百次模型调用,单次调用的耗时会被成倍放大,因此吞吐量对端到端任务时长的影响远大于单轮对话场景。

从成本角度看,单位时间内可处理的 token 数量,也直接决定了同一批硬件能支撑多少并发请求。在模型能力差距逐渐收窄的当下,速度与价格正在成为选型时与质量并列的考量项。

不过需要提醒的是,tokens/秒 只是单一维度的指标。评测所采用的硬件配置、批处理规模、上下文长度以及是否经过量化等信息,都会显著影响最终读数,因此在进行横向比较时应保持谨慎。真正决定一个模型能否落地的,仍然是速度、质量与价格三者的组合。

Mercury 2.5 的完整评测数据,可查阅 Artificial Analysis 的模型页面:https://artificialanalysis.ai/models/mercury-2-5

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。