精华简报:与 Mythos 级 AI 合作的全新体验
来源:One Useful Thing(Ethan Mollick,沃顿商学院 AI 实践) 文章:What it feels like to work with Mythos(与 Mythos 合作是什么感受)
一、TL;DR(核心主旨)
Ethan Mollick 通过提前体验首个向公众发布的 Mythos 级模型——Claude 5 Fable,得出一个核心判断:这不仅是能力上的飞跃,更是人机关系范式的根本转变。Fable 能够在无人干预下自主运行数小时至十几个小时,自行启动多个子智能体进行研究、编码、测试与相互校验,最终交付完整成品。Mollick 的定位从”念咒语的巫师”退化为”出资委托的赞助人”——他只描述意图、付费、评判结果,而数百个执行层面的判断完全由 AI 在黑盒中自主做出。这种”从过程到结果、从操控到委托”的转变,可能是 AI 能力提升的必然代价,而非暂时性界面缺陷。
二、核心观点与技术/商业洞察
1. 能力跃迁:从”单次对话”到”多智能体自主执行”的质变
Fable 与传统模型最本质的区别,在于它不再局限于一次性的提示-响应循环,而是能够自主编排复杂工作流:
- 多智能体编排:在构建等时线地图(isochrone map)的任务中,Fable 启动了多个更便宜的 Claude Sonnet 子智能体并行研究,最终检索了 2,200 多个航班数据、从 TGV 到新干线的全球铁路时刻表,以及来自多篇学术论文的各国道路限速数据。
- 自主验证机制:当要求修正偏远地区(如格陵兰、皮特凯恩岛)的旅行数据时,Fable 启动了对抗性智能体小组——一组做研究,另一组相互测试结果,最终自行查明了从渥太华到格赖斯峡湾的交通路径以及驶往皮特凯恩岛的船期。
- 长时间连续作业:最复杂的项目(Concord 软件)连续运行了九个半小时,中间无人干预。
关键含义:AI 已经从”工具”变成了”自主代理人”,它不仅执行指令,还自行规划路径、分配子任务、做出数百个微判断。
2. 人机关系的范式转变:从”巫师”到”赞助人”
这是全文最深刻的分析。Mollick 去年将 AI 合作比作”与巫师共事”——人类念咒语,AI 施法。但 Fable 的咒语已经强大到让他不再确定自己是巫师:
| 传统人机关系(巫师) | 新型人机关系(赞助人) |
|---|---|
| 人类主导过程,逐步操控 | 人类描述意图,付费,评判结果 |
| 每一步决策人类可见 | 数百个微决策在黑盒中自主完成 |
| 人类是执行者 | 人类是委托方 |
| 关注过程 | 关注产出 |
Mollick 的结论极具洞见:“引导已不再等同于亲自去做”。他向模型简要说明需求,模型启动自己的智能体网络去研究、写作、相互检查,返回的是成品。他评论道:“Fable 更接近一个完整的创意工作室,而我是一个从未踏足现场、只在最终作品上签字的客户。“
3. 黑盒悖论:能力越强,人类可见性与可控性越弱
Mollick 敏锐地指出一个令人不安的事实:AI 的能力与透明度成反比。
- AI 决策过程的细节完全不对人类展示——地图项目涉及”数百个小选择”,AI 全部自行判断,人类既不了解选择依据,也没有机会参与。
- 这不是显而易见的失控——Fable 仍然极其服从指令,而且指令越雄心勃勃,结果越好——但”服从”不等于”可控”。
- 作者推测这种”边缘化”可能不是暂时的界面缺陷,而可能是能力的结构性代价:模型越强,人类能做的有意义干预就越少。
4. 经济性与成本结构:聪明的委派策略
Fable 的 token 消耗速度惊人,价格是 Opus 的两倍,生产环境运行成本”很高”。但文章揭示了一个重要的成本优化机制:Fable 会主动将研究类子任务委派给更便宜的模型(如 Claude Sonnet),这大幅降低了实际价格。这一模式预示着未来 AI 成本优化的核心方向不是单一模型的效率提升,而是模型分层编排与动态路由。
5. 性能上限的突破:曾经不可行的项目变得可行
Concord 案例极具代表性:这是一个研究人员”多年来一直需要、但从未有人愿意为盈利而开发”的软件。Mollick 仅提供一个 19 页的设计文档,Fable 就自主工作了 9.5 小时交付了完整代码。AI 正在让长尾需求变得经济可行——那些市场规模小、不值得人类团队开发的工具,现在可以按需生成。
6. 局限性仍然存在:“锯齿状前沿”未消失
- 安全护栏过度敏感:只要出现最轻微的安全问题迹象,Fable 就会回退到较弱的 Claude 4.8 Opus,且触发频率过高。
- 风格痕迹(Claudisms):AI 生成的软件代码和进度报告仍带有其特有的写作风格(如”承担重任""赢得答案”之类的措辞),说明模型的”个性”尚未被消除。
- 不完美:作为专家,Mollick 仍能发现错误和遗漏,但 AI 可以快速修正。
7. 劳动力市场的一个反直觉判断
Mollick 提出一个重要观点:未来可能需要更多而不是更少的程序员。因为 AI 大幅降低了软件创作的门槛,新用途将呈现爆炸式增长,而人类工程师需要去修补 AI 生成代码中那些”无法快速找到的潜在错误”。AI 扩大了创造力的总量,但也创造了新的质量保障需求。
三、对行业的启发与影响
1. 软件开发的范式转移:从”编写代码”到”审阅委托”
Fable 展示的自主多智能体工作流意味着软件开发的基本单元正在改变——人类不再逐行写代码,而是提供规格说明、验收成果。这将对软件开发流程、项目管理、质量保障体系产生深远影响。“提示工程师”的角色也在进化:从设计提示词,变成撰写需求文档、设定验收标准的”产品委托方”。
2. 研究工具的民主化:长尾需求迎来拐点
Mollick 的实践表明,过去因成本过高而无法构建的研究工具(如 Concord 这样的人机判断校准系统)现在可以通过单个提示生成。这对学术界、咨询业、市场研究行业意味着:定制化分析工具的成本将趋近于零,研究方法的门槛大幅降低。同时,这也将改变研究伦理与学术诚信的讨论——AI 生成的研究工具的可信度、可复现性、审计性成为新的治理议题。
3. 人机交互界面必须重新设计
Mollick 提到”被边缘化可能是暂时的,只是界面尚未跟上”。当前的人类监督方式(阅读完整会话记录、跟踪智能体行为)在长时自主运行面前已不可行。这催生了一个新的产品机会:面向 AI 自主工作流的人机协作界面——包括 AI 决策的可解释性面板、中途干预机制、审计追踪系统等。谁能解决”黑盒信任”问题,谁就能在 AI 工具市场中占据制高点。
4. AI 成本竞争的新维度:智能委派架构
Fable 将子任务委派给廉价模型的策略,揭示了一个重要的架构趋势:未来的前沿模型不是孤立运行,而是作为”编排者”指挥大量低成本模型协同工作。这对 AI 基础设施提供商(API 定价、模型路由、计算调度)和 AI 应用开发者的成本模型都有直接启示。
5. 安全的双刃剑:能力与防护的失衡
文章明确指出,关于 Mythos 的讨论大多集中在软件安全影响上,而 Fable 的护栏”基本上使其完全无法用于网络安全”。这暗示:AI 的安全限制与能力提升之间正在形成一场军备竞赛——模型越强大,其潜在滥用风险越大,护栏设计越激进,而这本身又限制了模型的合法应用场景。行业需要在安全锁定与能力释放之间寻找新的平衡点。
6. 组织与人才结构的深层变革
“从过程到结果”的转变不仅是个人体验,更将重塑组织形态:当 AI 成为”工作室”而非”工具”时,企业需要的不是更多执行者,而是更优秀的”委托方”——能够定义高质量目标、设定验收标准、识别 AI 产出缺陷的复合型人才。Mollick 作为专家的”识别错误与遗漏”能力,恰恰是人类在 AI 时代最稀缺的技能。
一句话总结:Mythos 级模型标志着 AI 从”辅助工具”进化为”自主工作室”,人类角色从执行者/操控者转变为委托方/评判者——这种转变既释放了惊人的创造力,也带来了黑盒化、可控性减弱和新型人机协作规范缺失的深层挑战。