技术简报:多模态AI模型”你画我猜”基准测试深度分析
TL;DR
虎嗅网通过创新的”你画我猜”基准测试(1350张图/11961次猜测),首次系统评估了8款主流多模态AI模型的视觉表达能力与理解能力,结果显示GPT-6 Astra以75.5分险胜,但头部三强(GPT-6/Gemini 3.8/Claude 5.1)未显著拉开差距,测试同时揭示了当前AI在反常识理解、成本效率、自我认知等方面的重要局限。
核心洞察
技术维度
-
能力边界显性化:
- 常规词识别率达70-87%,但反常识题暴跌至21-34%(如”猫给人铲屎”零命中)
- 模型存在”自我认知失调”:MiniMax/DeepSeek自猜正确率比外部识别低10-13%
- 抽象概念具象化能力突出(如”孤独”六家同绘”深夜长椅+路灯”)
-
效能悖论:
- 思考token量与成绩负相关:Astra用最少token(232)获最高分,DeepSeek/Qwen用1.8万token反落后
- 元素数量与识别率弱相关:最少元素组(78.8%识别率) vs 最多元素组(75.4%)
-
工程突破:
- Astra展现”精准表达”能力:120个词中60张获全员猜中
- Claude实现动态思考调整:简单词零思考,复杂题数千token
商业维度
-
成本效率重构:
- 单次作画成本差异达43倍(GLM 0.04元 vs Claude 1.73元)
- 高价≠高效:Claude成本304元/74.3分 vs Gemini 82元/74.6分
- OpenAI主张”高价高效”获验证:Astra单次成本0.94元但任务完成度最优
-
评测方法论创新:
- 引入”机器评分”消除主观偏差(9模型交叉验证)
- 设计锚定词库防过拟合(30%未公开词)
- 置信区间量化(2000次重复抽样)
行业启示
-
技术发展路径:
- 需突破”常识依赖”:当前模型在反常识/热梗场景表现类似条件反射
- 多模态协同待加强:视觉表达与语义理解存在显著割裂(如”蒸馏”全画成实验器材)
- 动态计算分配将成为核心竞争力(如Claude的智能token分配)
-
商业应用影响:
- 成本评估需转向”任务完成效率”:单纯API价格比较已失效
- 垂直领域机会显现:GLM以1/30成本达头部90%性能,适合精度要求不高的场景
- 评测体系标准化需求突显:需建立跨厂商的评估框架
-
未来研究方向:
- 自我一致性优化(解决”自画不自知”问题)
- 反常识训练数据构建
- 多模态思维链技术开发
该测试标志着多模态AI评估进入”机器自治”新阶段,后续将整合进更完整的评测体系(含Agent Tank等),相关互动平台正在建设中。