精华简报|实测“开了眼”的 DeepSeek:认得马斯克,认不出梁文锋
来源:虎嗅网 / 蓝字计划
链接:https://www.huxiu.com/article/4885861.html?f=rss
TL;DR
DeepSeek 推出视觉理解实验模型 DeepSeek-V4-Flash-Vision-Exp,以极低图片 Token 成本补上多模态短板,官方跑分接近 Anthropic Opus 4.8。但真实用户实测与作者复测显示,该模型在人脸识别、梗图理解、复杂网页复刻等任务上仍存在明显短板,与豆包、GLM-5.3、Kimi K3 等竞品存在差距。文章判断,这并非一款打磨成熟的正式产品,而是 DeepSeek 以 V4-Flash 为底座、用“实验版”名义进行的一次公开测试,意在通过开发者真实反馈换取迭代方向。
核心观点与技术/商业洞察
1. 跑分与真实体验之间存在显著落差
官方数据显示,Vision-Exp 在多模态 Agent Benchmark 上已接近 Anthropic 的 Opus 4.8,但落到真实任务中,问题频繁暴露:
- 人脸识别翻车:把梁文锋认成王兴、张一鸣;面对时代少年团合照,不仅没认出人,反而判断“五个人长得太像、皮肤过于光滑、有 AI 感”,得出“这很可能是批量生成的假图”的离谱结论。
- 复杂任务效率低:在生成 Three.js 三维场景时,虽然成品完整度略优于 Gemini 3.7 Flash,但反复自我纠错、多次断联,Token 消耗高出近 15 倍,耗时多出 3.5 倍。
这说明当前多模态 Agent 的公开 Benchmark 仍难以覆盖真实场景中的细粒度视觉理解、人脸识别、跨模态推理与长链路稳定性。
2. 视觉能力不均衡:景物识别强,人脸/梗图/复杂 UI 弱
作者实测发现,Vision-Exp 的能力呈现明显分化:
- 自然景物识别与文案生成表现不错:能准确识别成都安顺廊桥,并描述光线、空间关系,甚至能生成朋友圈/小红书文案。
- 人脸识别与梗图理解薄弱:在一张复现特朗普遇刺名场面的 AI 梗图中,Vision-Exp 认出了梁文锋和马斯克,却把奥尔特曼判断为“AI 生成的陪衬”,且完全没有识别出背后的政治梗,只是望文生义地推测“调侃 DeepSeek 对美国 AI 行业的冲击”。
- 复杂网页复刻差距明显:在复刻幻方量化官网“算力随时待命”页面时,Vision-Exp 只能搭出整体框架,色块、图标、文字位置均被简化或错位;相比之下,GLM-5.3 页面观感更完整,Kimi K3 则还原了色块渐变和发光效果,层次更接近原图。
这种不均衡可能反映训练数据分布与对齐策略的偏向:自然图像/文字描述能力较强,但人脸、公众人物、复杂 UI 结构等高精度视觉编码能力仍不足。
3. “实验版”是有意为之的产品策略
DeepSeek 并未将 Vision-Exp 包装为正式产品,模型名中的 “Exp” 已明确其“实验版”定位。文章分析其策略逻辑:
- 用 V4-Flash 做多模态试验田:V4-Flash 总参数 284B、激活参数 13B,远小于 V4-Pro,本身更快、更便宜,适合控制图片带来的额外成本。低价能吸引开发者大量测试,把模型塞进各种 Agent 工作流。
- 不影响纯文本用户:Vision-Exp 没有取代原 V4-Flash,需要稳定纯文本能力的用户仍可继续使用旧模型,尝鲜多模态的开发者可主动切换,互不耽误。
- 延续 DeepSeek 的 Exp 发布传统:2025 年 9 月 V3.2-Exp 曾用实验版验证 DSA 稀疏注意力机制,两个多月后才推出正式版。Vision-Exp 同样是一场公开测试,先让“眼睛睁开”,用真实世界反馈生成问题清单。
4. 低价优势可能被低效消耗抵消
Vision-Exp 的定价极具 DeepSeek 风格:一张图片最多折算 384 个输入 Token,高峰期价格下约一分钱可看 8 张图。但 Three.js 任务中 Token 消耗高出近 15 倍、耗时多出 3.5 倍,说明单位图片成本低不等于实际任务成本低。如果模型在复杂任务中反复纠错、断联,最终消耗的 Token 和时间可能大幅抵消价格优势。
对行业的启发与影响
1. 多模态模型评估需要从“跑分”转向“真实工作流”
Vision-Exp 的案例再次证明,公开 Benchmark 高分并不等于真实可用。人脸识别、梗图理解、复杂 UI 复刻、长链路 Agent 稳定性等能力,很难通过现有跑分全面反映。行业需要更贴近开发者实际工作流的评估体系,否则容易陷入“跑分很美、体验一般”的认知偏差。
2. “实验版公开测试”成为 AI 模型迭代的常态
DeepSeek 通过低价实验版快速收集真实反馈,既控制了成本,又避免了正式版发布后的大规模翻车。这种“半成品先行、开发者共测”的模式,正在成为 AI 公司快速迭代的常见做法。但这也意味着用户需要容忍实验版的不稳定,并对正式版抱有更高期待。
3. 国内多模态竞争格局正在重塑
Vision-Exp 在部分任务上落后于豆包、GLM-5.3、Kimi K3,说明 DeepSeek 在多模态领域并非全面领先。豆包在人物识别上更准,GLM 和 Kimi 在复杂网页复刻上更完整,显示国内多模态模型竞争已进入细分能力比拼阶段。DeepSeek 的杀手锏仍是低价与开源生态,但如果视觉能力不能快速补齐,价格优势可能被效率劣势稀释。
4. 对开发者的实用建议
- 适合场景:低成本原型验证、简单图像理解、自然景物描述、快速搭建页面骨架。
- 谨慎场景:人脸识别、公众人物识别、复杂 UI 一比一复刻、需要稳定长链路执行的 Agent 任务。
- 成本注意:虽然图片 Token 单价低,但复杂任务中 Token 消耗可能成倍增加,需在真实工作流中评估总成本。
结语
DeepSeek-V4-Flash-Vision-Exp 的发布,标志着“鲸鱼”终于睁开了多模态的眼睛,但这双眼睛目前还只是“实验版”的视力:看得见景物,却认不准人脸;搭得起框架,却还原不了细节。它的真正价值或许不在于当下有多强,而在于 DeepSeek 用低价和开放测试换来的真实反馈。当正式版到来时,梁文锋的“滑动变阻器”会停在哪个位置,取决于这轮公开测试能暴露多少问题、以及 DeepSeek 能多快把它们修掉。