跳到主内容
快讯直播
AI智模界
模型

Gemini 3.5 Flash 引入 computer use 能力

Google DeepMind 在官方博客发布文章,宣布为 Gemini 3.5 Flash 引入 computer use(计算机操作)能力。

所谓 computer use,通常指模型不再只依赖结构化 API 或纯文本输入,而是通过读取屏幕画面理解当前界面,并直接输出点击、输入、滚动等操作指令,像人一样在图形界面中完成任务。这类能力把模型从"对话与生成"推向"执行",也让 Agent 的落地范围从代码与工具调用,扩展到浏览器、桌面软件以及各类没有开放接口的系统。

值得关注的是这次能力所处的模型档位。在 Gemini 产品线中,Flash 通常对应更强调响应速度与调用成本的定位,而 computer use 恰恰是 token 消耗较大、需要多轮"截图—推理—操作"循环的任务类型。两者结合,意味着这类功能可能更多面向高频、规模化、需要嵌入实际业务流程的场景,而非演示性质的单次尝试。

对从业者而言,接下来需要观察的通常是几件事:操作的准确率与容错机制,长流程任务中如何避免误操作,以及权限控制、审计与安全边界如何设计。当模型可以直接操作真实界面,一次错误不再只是一句答错的话,而可能是一次不可逆的提交或删除,这也让评测与护栏成为与能力本身同等重要的部分。

原文链接:https://deepmind.google/blog/introducing-computer-use-in-gemini-3-5-flash/

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。