精华简报:模拟成为新的规模法则——Joon Sung Park 与 Simile AI

来源:Latent Space
主题:从 Smallville 生成式智能体到人类行为基础模型,模拟如何从学术实验走向财富 100 强商业部署
核心人物:Joon Sung Park(Simile AI 联合创始人兼 CEO,Smallville/Generative Agents 论文作者)


一、背景:模拟式 AI 的“第二个夏天”

2024 年,Latent Space 曾提出“模拟式人工智能之夏”(Summer of Simulative AI),但当时判断其窗口期短暂。近期这一趋势强势回归:

  • SimGym 于 4 月发布;
  • Simile AI 完成 20 亿美元 B 轮融资,由 GreenOaks 和 Index Ventures 支持,知名支持者包括李飞飞、Andrej Karpathy;
  • 已为 CVS 等财富 100 强客户运行数千万次模拟;
  • 相较人类焦点小组,模拟结果达到 85–99% 准确率。

这标志着模拟不再只是学术概念,而是进入大规模商业验证阶段。


二、核心思想脉络:从生成式智能体到行为基础模型

Joon Sung Park 的学术起点是 2023 年里程碑论文 Smallville / Generative Agents,该研究证明 AI 角色能够记忆、规划、社交并产生涌现行为。如今他试图回答一个更大的问题:

如果我们能在做出决策之前先模拟这个世界,会怎样?

这一转变的本质是:从构建“会行动的 AI 角色”,转向构建人类行为的基础模型。其团队的核心追问是:“如果我们能直接重建我们所生活的世界,会怎样?”


三、技术方法:如何建模人类行为

Simile 的方法论强调多源数据 + 因果机制 + 分层建模,而非单纯依赖网络文本或前沿 LLM 提示。

1. 数据来源

  • 长式访谈:捕捉个体深层动机与态度;
  • 观察数据与交易数据:反映真实行为而非自我报告;
  • 随机对照试验(RCT):识别因果机制,而非仅相关性。

2. 模型架构

  • 群体层面模型:构建具有代表性的模拟人口;
  • 个体层面模型:创建个人数字孪生;
  • 后训练:针对“人们做出决策背后的因果机制”进行训练,而非仅优化预测准确率。

3. 关键成果

  • 创建了 1000 个真实人物的数字孪生;
  • 在复现人类行为和态度方面,数字孪生达到人类复现自己回答时准确度的 85%;
  • 商业场景中,模拟结果与人类焦点小组相比达到 85–99% 准确率。

四、关键洞察:为什么前沿 LLM 不足以模拟人类

Joon Sung Park 提出了几个反直觉但重要的判断:

  1. 网络数据捕捉的是人们“说什么”,而非“做什么”。真实行为数据(交易、观察)才能揭示实际决策模式。

  2. 被优化为理性的模型,往往无法模拟非理性的人类。好的模拟必须复现人类的偏见、错误和非理性行为,而不是消除它们。

  3. 提示工程存在局限。理解“社会物理学”可能需要改变模型权重,而不是仅仅对前沿 LLM 进行提示。记忆架构、Markdown 文件等外部手段只能部分弥补。

  4. 个人智能体需要深度的用户模型。真正有用的个人 AI 必须理解用户的深层行为模式,而非仅依赖对话历史。

  5. 预测未来不如理解如何塑造未来。模拟的核心价值不在于精确预测,而在于找到通往预期结果的违反直觉的路径。


五、商业验证与长期愿景

短期商业价值

  • 替代昂贵的人类焦点小组和市场研究;
  • 在产品、政策部署前进行低成本、大规模测试;
  • 为财富 100 强企业提供决策支持。

长期雄心

  • 模拟地球上全部 80 亿人;
  • 对整个社会的涌现行为进行建模;
  • 应对**气候变化、民主不稳定、全民基本收入(UBI)**等复杂社会问题;
  • 未来模拟可能需要整个数据中心级别的计算资源。

思想渊源

  • Thomas Schelling 的基于智能体建模(agent-based modeling)传统;
  • 阿西莫夫《基地》中的心理史学(psychohistory);
  • 模拟与绘画的类比:模拟不是复制现实,而是提炼本质;
  • 哲学问题:我们是否可能已经生活在模拟之中。

六、分析师评论

技术意义

Simile 代表了一种从“生成式 AI”向“模拟式 AI”的范式延伸。传统 LLM 擅长生成内容,但缺乏对真实人类行为因果机制的理解。Simile 通过 RCT 后训练和多源行为数据,试图构建行为基础模型,这可能是 AI 栈中的新层。

商业意义

如果 85–99% 的准确率可复制,Simile 将重塑市场研究、政策模拟、企业战略决策等领域的成本结构。焦点小组、问卷调查、试点测试等传统方法可能被大规模模拟部分替代。其 20 亿美元估值反映了市场对“决策前模拟”这一价值的认可。

风险与挑战

  • 评估标准:如何区分真实模拟与“堆叠 LLM 幻觉”仍是难题;
  • 伦理与隐私:个人数字孪生涉及深度行为数据,需严格治理;
  • 计算成本:模拟 80 亿人需要数据中心级资源,规模法则尚未完全验证;
  • 可复制性:学术成果(85% 复现准确率)能否在跨领域、跨文化场景中保持稳定,仍需观察。

关键判断

Simile 的核心主张——模拟是新的规模法则——如果成立,意味着 AI 竞争将从“更大的模型”转向“更真实的模拟”。这不仅是技术竞赛,更是对数据、因果机制和计算资源的综合考验。短期内,商业落地可能集中在市场研究和政策测试;长期看,社会级模拟可能成为治理复杂问题的工具,但也可能带来操纵风险。


一句话总结:Simile AI 正在将生成式智能体升级为人类行为基础模型,用多源数据和因果后训练构建数字孪生,其商业验证(85–99% 准确率)表明,模拟可能成为继模型规模之后的新增长曲线——核心不是预测未来,而是理解如何塑造未来。