精华简报:More than just code review

来源专栏:Simon Willison (AI 实用工程化)
文章标题:More than just code review(不仅仅是代码审查)
文章链接:https://simonwillison.net/2026/Aug/22/more-than-just-code-review/
标签:code-review, coding-agents, generative-ai, agentic-engineering, ai, llms


TL;DR

本文指出,在编码智能体(coding agents)日益普及的背景下,工程师最需要培养的核心能力不再是逐行编写代码,而是自信地指挥智能体进行修改,并自信地验证这些修改是否正确落地。逐行目测代码从来不是验证软件变更最有效的方式;真正高效的验证应当依赖测试、自动化检查、运行验证等多元手段。这意味着工程能力的重心正从“写代码”转向“管理代码生成与质量验证”。


核心观点与洞察

1. 编码智能体时代的核心技能:指令能力 + 验证能力

文章将有效使用编码智能体的关键技能拆解为两个环节:

  • 自信地指示(confidently instruct):能够清晰、准确、可执行地向智能体描述需要做出的变更。这要求工程师具备将模糊需求转化为明确规格的能力,包括边界条件、约束、预期行为等。
  • 自信地验证(confidently verify):在智能体完成修改后,能够判断变更是否以正确方式应用,而不是仅仅“看起来改了”。

这一洞察的深层含义是:编码智能体降低了“写代码”的门槛,但提高了“定义正确性”和“验证正确性”的门槛。 工程师的价值不再主要体现在敲击键盘产出代码,而在于对软件行为的精确理解和质量把控。

2. 逐行代码审查不是最有效的验证方式

文章明确提出一个反直觉但重要的观点:

Eyeballing every line of code has never been the most effective way to validate a change to a piece of software.
逐行目测代码从来都不是验证软件变更的最有效方式。

逐行审查存在明显局限:

  • 认知负荷高:大量代码变更时,人工逐行阅读容易遗漏逻辑错误、边界问题或跨模块影响。
  • 无法验证行为:代码“看起来正确”不等于运行时行为正确。逐行审查只能发现静态问题,难以覆盖并发、性能、集成等动态问题。
  • 效率低下:在 AI 可以批量生成代码的时代,如果仍然依赖人工逐行审查,验证环节会成为新的瓶颈。

因此,文章暗示:面对 AI 生成的大量代码,传统的“人肉 code review”模式需要升级为更系统化的验证策略。

3. 验证方式应当多元化

虽然文章没有逐一列举替代方法,但结合其长期观点和行业实践,可以合理展开为:

  • 自动化测试:单元测试、集成测试、端到端测试是验证行为正确性的第一道防线。
  • 类型检查与静态分析:在编译或 CI 阶段自动发现类型错误、空指针、未使用变量等问题。
  • CI/CD 流水线:将验证嵌入持续集成,确保每次变更都经过可重复的检查。
  • 运行验证与可观测性:通过本地运行、灰度发布、特性开关、日志、指标和追踪来验证真实行为。
  • 契约测试与快照测试:验证接口契约和输出结构是否符合预期。
  • Diff 审查 + 定向抽查:不再逐行阅读,而是聚焦高风险区域、关键路径或智能体容易出错的部分。

核心逻辑是:验证的目标是“行为正确”,而不是“代码看起来正确”。 因此,任何能够证明行为正确性的手段,都比单纯逐行阅读更可靠。

4. 工程能力的范式转移:从“生产者”到“管理者/验证者”

文章虽然简短,但指向一个更大的趋势:

  • 传统模式:工程师主要承担代码生产 + 人工审查。
  • AI 智能体模式:智能体承担代码生产,工程师承担需求定义、架构设计、验证策略制定、质量把关。

这意味着工程师需要具备更强的:

  • 系统思维:理解变更对整体系统的影响。
  • 测试设计能力:知道如何设计有效的验证方案。
  • 工具链整合能力:将 AI 智能体接入现有质量保障体系。
  • 风险判断能力:识别哪些变更需要深度审查,哪些可以依赖自动化验证。

启发与影响

对工程师个人

  • 技能栈需要重构:除了编程能力,更需强化测试设计、自动化验证、CI/CD、可观测性等“质量工程”能力。
  • 角色定位转变:从“代码编写者”转向“AI 编码的管理者与验证者”,核心竞争力在于判断力和验证策略,而非打字速度。
  • 效率提升的关键路径:能否建立一套可信的验证体系,决定了能否放心地让 AI 大规模生成代码。

对团队与组织

  • 代码审查流程需要重新设计:如果团队仍以“逐行 review AI 生成的代码”为主要质量关卡,将很快成为效率瓶颈。应引入分层验证:自动化检查先行,人工审查聚焦高风险决策。
  • 投资验证基础设施:测试覆盖率、CI 速度、静态分析工具、可观测性平台等将成为 AI 编码时代的核心基础设施,其重要性不亚于代码库本身。
  • 质量文化升级:从“相信人眼”转向“相信系统”,建立可重复、可度量的质量门禁。

对工具与行业

  • 新一代验证工具的机会:围绕 AI 生成代码的验证需求,可能催生更智能的 diff 分析、行为验证、自动测试生成、AI 代码风险评分等工具。
  • 代码审查工具的重心转移:从展示“代码变了什么”转向回答“行为是否按预期改变”,例如结合测试结果、运行时数据、影响面分析的智能审查面板。
  • AI 工程化的成熟标志:当组织不再依赖人工逐行审查 AI 代码,而是建立起自动化验证闭环时,才真正进入“智能体工程(agentic engineering)”的成熟阶段。

一句话总结:AI 编码智能体真正考验的不是你能否看懂它写的每一行代码,而是你能否建立一套比“逐行目测”更可靠的验证系统,从而自信地驾驭 AI 产出。