技术简报:GPT-6 Astra与GPT-5.6系列图像生成能力对比分析

TL;DR

Simon Willison通过对比GPT-6 Astra与GPT-5.6系列(Sol/Terra/Luna)生成”骑自行车鹈鹕”SVG图像的质量和成本,发现Astra在所有推理级别(低到最大)均显著优于前代模型,且token效率更高,尽管标价翻倍但实际性价比突出,同时揭示了不同模型架构间可能存在未公开的技术关联。


核心洞察

技术性能

  1. 质量跃升:

    • Astra最低精度(low)的输出已全面超越GPT-5.6 Sol所有模式(包括xhigh/max)
    • 最大模式(max)可生成接近完美的具象化图像,而前代产品仍呈现明显抽象特征
    • 仅在高阶模式(max)才能稳定实现双侧鹈鹕腿的物理合理性
  2. 效率优化:

    • 输入token减少38%(Astra/Luna用16token vs Sol/Terra用26token)
    • 相同预算(10美分)下,Astra低模式质量远超其他模型同价位输出

商业价值

  1. 定价策略:

    • 表面价格翻倍(50 vs 30每百万次),但token效率提升缩小实际差距
    • 实现”降本增效”:用户可用更低精度档位获得前代顶级精度效果
  2. 产品定位:

    • 通过可视化对比验证代际性能差距,强化高端产品溢价能力
    • 输入token一致性暗示Astra/Luna可能共享底层架构(商业保密考量?)

行业影响

  1. 技术迭代验证:

    • 证实生成式AI在具象化细节和物理合理性方面取得实质性突破
    • 多精度档位输出能力为工业级应用提供更灵活的精度/成本选择
  2. 市场竞争启示:

    • 价格敏感型市场可能仍被前代产品占据,但专业领域将快速转向新模型
    • token效率成为新竞争维度,传统”按调用计费”模式需重新评估
  3. 评测方法论:

    • 采用”固定命题+多维度对比网格”的评测方式具有可复现性
    • 通过趣味性用例(鹈鹕骑车)直观展示技术差异,降低公众理解门槛

注:骑自行车鹈鹕可能成为新一代AI图像生成能力的基准测试用例

🔗 知识库双向关联