跳到主内容
快讯直播
AI智模界
模型

OpenAI 宣布 ChatGPT 现已能看、听、说

OpenAI 在其官网发布消息,宣布 ChatGPT 现在能够"看、听、说"(can now see, hear, and speak)。这意味着 ChatGPT 的交互方式从单一的文本输入输出,扩展到了语音与视觉:用户可以用语音与它对话,也可以让它理解图像内容。

发生了什么

对长期以文字输入为主的对话式 AI 来说,这是一次交互层面的扩展。此前用户需要先把想法"转译"成文字,如今可以直接说、直接拍。多模态输入降低了使用门槛,也让模型有机会在同一轮对话中同时处理语言与视觉信息。

为什么重要

  • 交互范式:语音成为一等公民的输入输出通道,为实时语音对话、无障碍使用、车载与可穿戴设备等场景打开空间,产品形态不再被键盘与屏幕约束。
  • 能力边界:从"读文字"到"看图像",模型的感知范围扩大,可承载的任务从问答、写作延伸到对现实世界内容的描述与推理。
  • 竞争格局:多模态已是头部模型厂商的必争之地。语音与视觉能力的补齐,会进一步抬高行业基线,并促使应用层重新设计交互与产品结构。

值得关注的点

对开发者而言,需要留意的是接入方式、能力边界与成本结构的变化,以及多模态输入如何影响提示设计与评测方法;对普通用户而言,最直接的变化是与 AI 交流的方式更接近日常沟通。相关能力的具体可用范围与限制,以官方发布页面为准。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。