精华简报:聊天机器人的黄昏

📌 TL;DR(一段话总结)

人工智能正经历超指数级能力增长,前沿模型(Anthropic、OpenAI)与近前沿开放权重模型(中国厂商)均沿指数曲线快速攀升;更重要的是,AI的使用范式正从”人类与聊天机器人协作”转向”人类管理自主智能体(Agent)“——AI已能自主连续工作9至14小时,完成相当于人类团队数周的工作量。作者指出,当前AI领域的动荡(政策突变、市场震荡)并非泡沫,而是以人类速度运转的机构在追赶非人本质的能力曲线时不可避免的错位,且鸿沟只会持续扩大。


🔍 核心观点与技术/商业洞察

1. 能力增长呈超指数加速,而非线性

  • 发布节奏加快:美国三大前沿实验室(Anthropic、OpenAI、Google)发布更强模型的速度比以往任何时候都快(政府干预曾暂时封锁Claude Fable与GPT-5.6)。
  • 实测能力暴涨:三大权威评估(METR、英国AI安全研究所、GDPval)一致显示,AI单次提示词可完成的人类工作量以优于指数级的速度增长。
  • 自主工作时间跃升:
    • Epoch实验:Opus 4.7自主运行14小时,构建了人类工程师需2至17周完成的软件包,成本仅251美元。
    • 作者亲测:Fable自主工作9小时,完成人类团队需一周以上的复杂软件项目。
    • 关键转折:2025年冬之前,AI只能做几小时工作且错误率高;数月后,单次提示词可驱动16小时以上有效工作。

2. 前沿格局:美国闭源 vs 中国开放权重

  • 前沿模型由三家美国公司垄断(Anthropic、OpenAI、Google),为专有模型。
  • 中国开放权重模型落后前沿6至12个月,但沿着自己的指数曲线追赶,且运行成本低廉——形成”性能次优但成本极低”的竞争维度。
  • 提醒:基准测试分数可能虚高,开放权重模型在实际任务中表现未必与基准一致。

3. 范式转移:从”协作智能”到”智能体管理”

  • 旧范式(聊天机器人):人类逐轮提示、检查结果、引导下一步——需要持续人工介入。
  • 新范式(智能体):长时间运行、自我纠错、无需持续干预;配合框架(Harness)与专用应用(Claude Code、OpenAI Codex),能力进一步放大。
  • OpenAI内部数据佐证:
    • 25%员工每周同时运行至少4个智能体;
    • 法务、HR等非技术部门采用智能体的速度几乎与程序员相同——OpenAI是工作变革的”煤矿金丝雀”。
  • 关键发现(Claude Code用户研究):决定成功与否的不是职业,而是领域专业度——专家在使用AI时成功率和产出价值均显著更高。

4. 核心结论:把自己当成AI的管理者

我们正从”非专家用聊天机器人填补空白”走向”专家用智能体完成工作”。最佳实践是:将任务分解、分配给智能体,并像管理者一样监督、评估和纠偏。

5. 动荡的本质:指数曲线 vs 人类速度机构

  • 人们将AI领域的剧烈摇摆(网络安全威胁突现、政策仓促调整、股价巨震)误读为”不成熟领域终将稳定”。
  • 作者判断:不稳定不会短期内消失——当以人或委员会速度运转的机构试图追赶非人类本质的能力指数曲线时,落差只会持续拉大。

💡 行业启发与影响

  1. 企业AI战略必须全面重写:任何在2025年冬之前制定的AI计划都已过时——它描述的是一个”能做几小时工作且高错误率”的系统,而现实已跃迁至”单次提示词驱动16小时以上自主工作”。规划周期应压缩至季度甚至月度。

  2. 组织架构与岗位定义将重构:当编码由AI在专用框架中完成,“人人都是程序员”成为现实。真正的分水岭是领域专业度——各职能专家(法务、HR、市场)借助智能体放大自身能力,而非被AI取代。组织应投资于”专家×AI”的复合能力建设。

  3. 竞争门槛的二元分化:美国闭源前沿模型与低成本开放权重模型(尤其中国厂商)形成两个平行战场。企业需根据任务敏感性、成本预算、合规要求构建混合模型组合,而非押注单一供应商。

  4. “AI管理者”成为核心技能:提示工程(Prompt Engineering)的重要性下降,“任务分解、智能体调度、结果验收、异常干预”的管理能力成为新刚需。人才培养重心应转向此方向。

  5. 治理与政策的滞后性将加剧:技术能力的指数跃迁与政策响应的线性速度之间的鸿沟,意味着监管空白期和突击式干预将成为常态。企业应建立内部治理预案而非等待监管框架成熟。

  6. 对投资与市场的启示:AI概念股的剧烈波动并非非理性炒作,而是市场在”旧商业模式突然被颠覆”与”新能力突然被验证”之间的反复定价。长期来看,能有效将智能体融入组织流程的公司,将获得结构性优势。