精华简报:开源模型正在迎头赶上吗?
来源:SemiAnalysis
文章标题:Are Open Models Catching Up?
核心议题:开源模型与闭源前沿模型的能力差距是否正在缩小?模型层是否会商品化?
一、核心结论
开源与闭源模型的能力差距呈周期性波动,且开源模型的追赶速度正在加快——每一代开源模型追上该时代首个闭源模型所需的时间缩短一半。
过去两个月,开源 AI 进入爆发期。与 2025 年 1 月“DeepSeek 时刻”不同(当时 R1 缺乏实际经济价值),GLM 5.3 和 Kimi K3 等开源模型已能胜任大量编码与智能体任务——正是这些任务推动 Anthropic 的 ARR 突破 650 亿美元。开源模型的成功引发了市场对模型层商品化的担忧,但 SemiAnalysis 认为,这种担忧可能被夸大。
二、关键数据与事实
- Fireworks 单日处理 token 量超过 40T,是 3 月底 OpenAI API 用量的 2 倍。
- Anthropic ARR 超过 650 亿美元(SemiAnalysis 称其数据比业内其他夸大数字更接近现实)。
- 开源模型在编码和智能体任务上已具备与闭源前沿模型竞争的能力,且成本极低。
三、分析框架:三个时代与周期性差距
文章提出,LLM 发展至今可分为三个时代:
- 早期扩展时代(Early Scaling)
- 推理时代(Reasoning)
- 智能体时代(Agentic)
每个时代都代表了模型实用性的阶跃式提升。基准是特定时代的产物:新基准旨在区分当时模型的能力差异,一旦被模型饱和,便失去意义。因此,不能跨时代使用单一基准衡量模型进步,而应分时代评估。
在每个时代初期,前沿实验室(如 OpenAI、Anthropic)率先完成研究突破,训练出领先模型并大规模部署,取得领先优势。随后,其他实验室通过逆向工程、蒸馏等手段复制关键进展,缩小差距。“没有什么能永远保密——尤其是考虑到蒸馏。”
四、核心发现:追赶时间每代减半
SemiAnalysis 选取每个时代的相关模型,运行一组精心策划的基准,计算综合能力得分。结果显示:
每一代开源模型追上该时代第一个闭源模型所需的时间,都比上一代缩短一半。
这一趋势表明,开源模型的复制与追赶效率正在快速提升,闭源模型的领先窗口期持续压缩。
五、方法论要点
- 模型选择:每个时代选取一个 SOTA 闭源模型和一个 SOTA 开源模型;存在争议时(如 Fable 5 vs GPT 5.6)保守地同时测试两者。
- 基准选择:结合个人判断与流行度。例如:
- Humanities Last Exam (HLE):推理时代标志性基准,虽有已知问题,但无相近替代。
- SWE-bench Pro:流行但有问题,可用 DeepSWE 近似。
- 评估执行:大部分基准由 SemiAnalysis 使用 Prime Intellect 的评估栈自行运行;部分来自 Artificial Analysis 和 Datacurve 的 DeepSWE 排行榜。
- 开源模型服务方式:按发布时的原始条件运行(vLLM 版本、当时硬件、模型卡采样设置);闭源模型则针对其固定版本运行。
六、对产业的影响与展望
开源模型的成功引发了 FUD(恐惧、不确定、怀疑):如果开源模型能以极低成本保持足够能力,模型层是否会被商品化?这对前沿实验室的利润率将是灾难性的。
然而,SemiAnalysis 暗示,这种担忧可能被过度放大。文章后续(未提供部分)将把分析延伸到未来,并解释为什么对前沿模型的看空程度可能低于初步印象。可能的逻辑是:尽管开源追赶速度加快,但前沿实验室仍能通过持续创新、规模优势、工具生态和智能体工作流等保持差异化,且每个新时代的开启都会重新拉开差距。
七、局限性与注意事项
- 基准本身存在缺陷(如 HLE、SWE-bench Pro 的问题),综合得分并非完美衡量。
- 模型选择具有主观性,尽管反映了专家共识。
- 分析基于历史数据,未来趋势可能受算力、数据、算法突破等因素影响。
- 文章后续部分未提供,关于“为何对前沿模型没那么看空”的详细论证尚不完整。
一句话总结:开源模型正在以加速的节奏追赶闭源前沿,但模型层商品化的担忧可能为时过早——差距的周期性波动意味着前沿实验室仍有机会在每个新时代重新建立领先优势。