技术简报:多模态AI模型”你画我猜”基准测试深度分析

TL;DR

虎嗅网通过创新的”你画我猜”基准测试(1350张图/11961次猜测),首次系统评估了8款主流多模态AI模型的视觉表达能力与理解能力,结果显示GPT-6 Astra以75.5分险胜,但头部三强(GPT-6/Gemini 3.8/Claude 5.1)未显著拉开差距,测试同时揭示了当前AI在反常识理解、成本效率、自我认知等方面的重要局限。

核心洞察

技术维度

  1. 能力边界显性化:

    • 常规词识别率达70-87%,但反常识题暴跌至21-34%(如”猫给人铲屎”零命中)
    • 模型存在”自我认知失调”:MiniMax/DeepSeek自猜正确率比外部识别低10-13%
    • 抽象概念具象化能力突出(如”孤独”六家同绘”深夜长椅+路灯”)
  2. 效能悖论:

    • 思考token量与成绩负相关:Astra用最少token(232)获最高分,DeepSeek/Qwen用1.8万token反落后
    • 元素数量与识别率弱相关:最少元素组(78.8%识别率) vs 最多元素组(75.4%)
  3. 工程突破:

    • Astra展现”精准表达”能力:120个词中60张获全员猜中
    • Claude实现动态思考调整:简单词零思考,复杂题数千token

商业维度

  1. 成本效率重构:

    • 单次作画成本差异达43倍(GLM 0.04元 vs Claude 1.73元)
    • 高价≠高效:Claude成本304元/74.3分 vs Gemini 82元/74.6分
    • OpenAI主张”高价高效”获验证:Astra单次成本0.94元但任务完成度最优
  2. 评测方法论创新:

    • 引入”机器评分”消除主观偏差(9模型交叉验证)
    • 设计锚定词库防过拟合(30%未公开词)
    • 置信区间量化(2000次重复抽样)

行业启示

  1. 技术发展路径:

    • 需突破”常识依赖”:当前模型在反常识/热梗场景表现类似条件反射
    • 多模态协同待加强:视觉表达与语义理解存在显著割裂(如”蒸馏”全画成实验器材)
    • 动态计算分配将成为核心竞争力(如Claude的智能token分配)
  2. 商业应用影响:

    • 成本评估需转向”任务完成效率”:单纯API价格比较已失效
    • 垂直领域机会显现:GLM以1/30成本达头部90%性能,适合精度要求不高的场景
    • 评测体系标准化需求突显:需建立跨厂商的评估框架
  3. 未来研究方向:

    • 自我一致性优化(解决”自画不自知”问题)
    • 反常识训练数据构建
    • 多模态思维链技术开发

该测试标志着多模态AI评估进入”机器自治”新阶段,后续将整合进更完整的评测体系(含Agent Tank等),相关互动平台正在建设中。

🔗 知识库双向关联