我们需要的是视觉还是理解 去年组会上导师抛出一个灵魂拷问一个生下来就失明的人通过触觉和语言学习能否理解红色这个概念如果能他算不算具有视觉能力如果不能我们现在的多模态大模型算什么整个会议室沉默了半分钟。这个问题触及了计算机视觉最根本的追问视觉的本质到底是什么是像素层面的感知能力还是在概念层面理解和推理视觉世界的能力如果放在五年前答案似乎不言自明。视觉当然是感知——从图像中提取特征进行检测、分割、识别。这些都是经典的视觉任务每个任务有明确的输入输出有标注好的数据集有量化的评价指标。视觉领域的研究范式在过去十年里已经被打磨得近乎完美找一个问题收集一个大规模标注数据集设计一个深度学习模型刷榜。但大语言模型的崛起彻底搅乱了这潭水。GPT-4V和Gemini Pro Vision这些多模态模型展现出的视觉能力令人困惑。它们能描述图片内容能回答关于视觉细节的问题能进行空间推理甚至能理解漫画里的幽默。但它们从来没看过任何东西——它们只是把图像切成patch用Transformer处理后和文本token混在一起做自回归生成。这算什么这是视觉吗更令人不安的是这些模型在某些需要理解而非感知的任务上表现出了远超传统视觉模型的水平。给一张满是餐具的杂乱厨房照片问它这个家庭可能刚刚吃了什么传统的检测模型只能输出碗、盘子、杯子这些物体列表。而多模态LLM会观察残留在碗底的汤色、桌上的调料瓶、用过的餐巾数量然后推断可能吃了火锅而且至少有三个人一起用餐。这种推理能力是传统视觉系统完全不具备的。但与此同时多模态LLM在一些看似基础的感知任务上却表现得令人尴尬。你让它数照片里有几个人如果人稍微多一点或者有重叠遮挡它经常数错。你让它精确标定物体的边界它做不到因为它没有像素级别的输出能力。你让它判断两个人脸是不是同一个人它的精度远低于专门的FaceNet模型。所以多模态LLM到底获得了什么它获得的是一种概念层面的视觉理解。它知道物体的名称、属性、用途、相互关系、场景典型配置、文化含义。它知道红色的苹果通常放在果盘里而不是放在马桶上。它知道雨天的街道会有积水和倒影行人会打伞。这些知识让它的描述和推理听起来像模像样但它缺乏对像素的精确把握。这让我想起认知科学里的盲视现象。某些脑损伤患者声称自己看不见但如果强迫他们猜测面前物体的位置或运动方向他们的正确率显著高于随机水平。他们拥有视觉处理的能力但失去了对视觉的主观体验。多模态LLM是不是反过来——拥有类似视觉体验的概念理解但缺乏精确的底层视觉处理从认知架构上看传统视觉模型和多模态大模型代表了两种不同的路径。传统路径是bottom-up的——从像素到边缘到部件到物体再到场景逐层抽象。大模型路径更像是top-down的——从语言习得的概念网络向下投射到视觉域用语言作为锚点来组织视觉理解。这解释了为什么多模态LLM在描述和理解方面出色但在精确感知方面吃力。它的视觉能力是通过语言这面棱镜折射出来的语言能捕捉到的东西它能做得好语言难以描述的东西它就处理不了。你能用语言精确描述一个人的面部几何以至于可以用于身份识别吗很难。所以多模态LLM在人脸识别这类任务上必然不如专用模型。那么这两种路径能否融合目前的前沿探索正是朝这个方向走。一些工作在尝试给多模态LLM装上像素级别的输出头让它不仅能谈论图像还能操作图像——做分割、做深度估计、做图像编辑。另一些工作则试图把传统视觉模型的精确感知能力作为工具接入LLM的推理框架让语言模型学会调用这些工具。但我觉得最根本的问题还是我们一开始说的那个视觉到底是什么如果视觉的核心是对物理世界的概念性理解那么多模态LLM已经走在正确的道路上了。如果视觉的核心是精确的像素级感知那么传统的卷积网络和Transformer仍然不可替代。如果视觉是两者的结合——就像人类视觉系统既有低级的特征检测也有高级的语义理解——那么未来一定属于能让这两种能力无缝协作的架构。回到导师那个问题。通过触觉和语言学习的盲人能否真正理解红色我觉得他能理解红色在概念空间中的位置——它和暖色的关系它在文化中的含义它产生的情绪联想。但他永远无法拥有看到红色时的那个质感那种无中介的、直接的感官体验。多模态大模型或许也是这样——它能概念性地理解视觉世界但它没有那个质的感受。但话说回来对于绝大多数实际应用场景我们需要的是理解而非感受。一个医生AI助手不需要感受X光片上的病灶带来的视觉质感它只需要准确识别和分析。从这个角度看多模态LLM的伪视觉可能已经足够解决很多真实问题了。而我们这些做传统计算机视觉出身的人可能需要重新审视自己领域的边界了。

相关新闻

最新新闻

SerenityOS 命令行选项解析指南:getopt 与 getopt_long 用法、返回值与底层实现

SerenityOS 命令行选项解析指南:getopt 与 getopt_long 用法、返回值与底层实现

SerenityOS 命令行选项解析指南:getopt 与 getopt_long 用法、返回值与底层实现 【免费下载链接】serenity The Serenity Operating System 🐞 项目地址: https://gitcode.com/GitHub_Trending/se/serenity 导读 本文以 getopt(3) 手册 为核心&a…

2026/9/21 18:32:40
轻量服务器还是ECS?大促云服务器选购与避坑实战指南

轻量服务器还是ECS?大促云服务器选购与避坑实战指南

每年大促节点,群里永远有人在问同一个问题:“38元的轻量服务器到底怎么抢?为什么我每次点进去都是已售罄?68元直购和99元的ECS我到底选哪个?”作为一个常年帮团队和自己采购云服务器的老用户,我太清楚这种纠…

2026/9/21 18:32:39
为 AI 代理的 Review 动作编写 Cedar 审批门控策略:review-agent-governance 策略编写实战指南

为 AI 代理的 Review 动作编写 Cedar 审批门控策略:review-agent-governance 策略编写实战指南

为 AI 代理的 Review 动作编写 Cedar 审批门控策略:review-agent-governance 策略编写实战指南 【免费下载链接】agents Multi-harness agentic plugin marketplace for Claude Code, Codex, Cursor, OpenCode, GitHub Copilot, and Google Antigravity 项目地址:…

2026/9/21 18:31:24
PaddleOCR 手写数学公式识别算法 CAN 实战指南:Counting-Aware Network 训练、评估与推理部署

PaddleOCR 手写数学公式识别算法 CAN 实战指南:Counting-Aware Network 训练、评估与推理部署

PaddleOCR 手写数学公式识别算法 CAN 实战指南:Counting-Aware Network 训练、评估与推理部署 【免费下载链接】PaddleOCR Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between i…

2026/9/21 18:31:34
Spring源码解析:构造器注入的类型转换与候选匹配机制

Spring源码解析:构造器注入的类型转换与候选匹配机制

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/21 18:31:25
openai-agents-python 多模型接入指南:深入解析 AnyLLMModel 适配层与 any-llm 路由

openai-agents-python 多模型接入指南:深入解析 AnyLLMModel 适配层与 any-llm 路由

openai-agents-python 多模型接入指南:深入解析 AnyLLMModel 适配层与 any-llm 路由 【免费下载链接】openai-agents-python A lightweight, powerful framework for multi-agent workflows 项目地址: https://gitcode.com/GitHub_Trending/op/openai-agents-pyth…

2026/9/21 18:31:13

日新闻

周新闻