OpenAI 官网出现一篇题为 "Thinking with images" 的内容页面,在资讯分类中归入“模型”方向。该热点目前仅公开了标题与链接,页面具体内容、是否伴随新模型或新功能发布,仍有待官方信息确认。
从标题看,主题指向“以图像进行思考”,即让模型把视觉信息纳入推理过程本身,而不是仅把图片当作一次性输入编码。这与近期多模态模型的发展方向一致:业界正尝试让模型在推理环节反复生成、调用和检查视觉中间结果,以提升图表理解、文档解析、界面操作等任务的可靠性。
若这一思路落地,视觉推理的可解释性与复杂任务的准确率都可能受益,也会影响多模态模型的评测方式与产品形态。具体能力边界、适用范围与可用时间,仍需以官方发布为准。
