精华简报|越会用 AI 的人,学习能力退化得越快
来源:极客公园|作者:张勇毅
链接:http://www.geekpark.net/news/369212
TL;DR
本文以一项覆盖 2.7 万名中国中学生、历时 30 个月的研究为核心证据,指出 AI 在显著提升作业分数与效率的同时,使闭卷考试成绩平均下降 20%,且使用越深、越久,惩罚越大。其机制不是 AI 降低智商,而是“认知卸载”抽走了试错、推演、打草稿等形成心智模型的关键工序。成年人场景——医生、写作者、知识工作者、程序员——已出现同类能力退化,但因缺乏“月考”而更隐蔽。数据还证明,“正确使用 AI”只是维持不到半年的过渡状态,而非稳定解。行业需要从教育评估、企业能力管理、产品设计和个人工作流四个层面建立对抗机制。
关键数据速览
| 指标 | 数据 |
|---|---|
| 作业分数变化 | 平均 +18% |
| 作业用时变化 | 64 分钟 → 45 分钟(约 -30%) |
| 闭卷月考成绩 | 平均 -20%,相当于 1.4 个标准差 |
| 分科惩罚 | 社科 -27%、数学 -22%、英语 -17%、语文 -9% |
| 群体差异 | 初中生比高中生严重约四成;男生比女生严重;原成绩最好的学生跌得最狠 |
| AI 采纳率 | 2022 年 9 月几乎为 0 → 2025 年 6 月达 80% |
| 外包比例 | 初用 AI 者 58% → 用满 5 个月 81%;完全外包从 34% → 50% |
| 成年人证据 | 医生腺瘤检出率相对下降 20%;MIT 实验中神经连接强度最多低 55%;程序员用 AI 实测变慢但自觉快 20% |
核心观点与洞察
1. AI 制造了“表现—能力”剪刀差
研究最刺眼的发现是:作业分数第一次开始“撒谎”。
用 AI 的学生作业分平均上涨 18%,用时缩短 30%,但闭卷月考成绩反而比不用 AI 的同学低 20%。作业分原本是学习能力的可靠晴雨表,但在 AI 介入后,作业分越高,往往只意味着 AI 用得越深。于是出现一条反常曲线:用得越狠的孩子,考试跌得越惨。
这揭示了一个更普遍的风险:当产出指标与真实能力脱钩,组织和个人都可能被表面绩效误导。
2. “正确使用 AI”是一个过渡态,不是稳定解
论文给“外包”下了数值定义:作业用时少于 50 分钟算“内包”,少于 45 分钟算真“外包”。
刚开始用 AI 的学生中,外包占 58%;用满 5 个月后,外包比例升至 81%,完全外包从 34% 升至 50%。更关键的是:采纳满 6 个月后,没有一个 AI 学生的作业用时还超过 65 分钟。
那些花足够时间、只把 AI 当家教的“模范用户”,几乎全是刚上手不到 5 个月的新手。论文作者的解释很短:AI 挤掉的,是强度最高的那部分努力。
这意味着“只要教会孩子正确使用 AI 就会好”是一种安慰性假设。数据给出的回答是:没有人能一直正确使用。因为作业分在涨、家长在点赞、提交记录越来越整齐,每一个反馈都在强化“再快一点也没关系”的畸形激励。
3. 认知卸载的位置,决定了伤害的深度
认知科学把“把本该在自己脑子里跑的过程交给外部工具”称为“认知卸载”。
计算器和导航也是认知卸载,但 AI 接走的不是运算和记路,而是打草稿、试错、推演——恰好是心智模型长出来的那道工序。
学生版本:作业是草稿,考试是 Debug。草稿外包出去,Debug 那天就露馅。
成人版本:从“写代码”变成“审代码”,从执行者变成把关人。但把关的前提是脑子里有一份自己的底稿。没亲手推演过的人,审的其实是个黑箱;AI 的逻辑链一旦错在深处,他连该从哪里起疑都不知道。
4. 成年人同样在“没有月考的考场”里退化
文章列举了四次成年人场景的预警:
- 医生:波兰 19 名资深医生用 AI 辅助肠镜几个月后,脱离 AI 的腺瘤检出率从 28.4% 降至 22.4%,相对下降 20%。
- 写作者:MIT 脑电实验中,用 ChatGPT 写作的学生神经连接强度比纯靠自己写最多低 55%;83% 的人连自己文章里的一句话都复述不出来。研究团队称之为“认知负债”。
- 知识工作者:微软研究院与 CMU 调查 319 名知识工作者,发现对 AI 输出越有信心的人,自己动脑核查的投入越少。
- 程序员:METR 实验中,资深程序员用 AI 实测变慢,自己却觉得快了 20%;今年 2 月想复测时,大多数开发者已拒绝在没有 AI 的情况下工作。
四次预警指向同一件事:AI 在场,产出变好;AI 离场,能力变差。
区别在于,学生每月有闭卷考试把曲线摆到台面上,而大多数成年人的工作没有月考。
5. 惩罚是累积性的,短期研究系统性低估风险
论文指出,AI 学习惩罚需要约两年才“长满”。全体 AI 用户的平均升学考试效应约 7%,但用满两年以上的完整惩罚要大得多。
这意味着那些只观察几星期、几个月的研究,都在系统性低估 AI 的学习成本。
不过论文也留了一点余地:同样用满 5 个月,2023 年初的学生平均损失 25%,2025 年 6 月已收窄至 16%。师生在适应,工具侧也在改进,但损失没有归零的迹象。
启发与影响
对教育行业
- 作业作为评估工具正在失效。学校需要重新设计形成性评估,不能再用作业分预测考试表现或学习能力。
- 引入“无 AI 闭卷”场景。不是禁止 AI,而是明确区分“AI 辅助练习”与“独立能力考核”,否则家长和教师都会被作业分误导。
- AI 素养教育必须超越“使用方法”。需要教元认知、刻意练习和“何时不用 AI”的判断力,否则越会用的学生可能退化越快。
对企业与知识工作
- 绩效指标可能同样失真。AI 辅助下产出增加,但个体判断力可能下降,形成“集体能力空心化”。企业需要建立“认知审计”:定期在无 AI 条件下评估关键岗位的基础能力。
- 保留“无 AI 演练”和人工底稿。对关键决策、代码审查、风险判断,应要求先有独立推演,再用 AI 校验,而不是直接接受 AI 输出。
- 警惕“自觉变快”的元认知偏差。METR 实验显示,程序员实测变慢却自觉快 20%。管理者不能只依赖员工自我报告。
对 AI 产品与工具设计
- 商业激励与“合意难度”存在冲突。一键生成、降低摩擦是当前产品主流,但可能加速用户能力退化。未来差异化可能来自“教练型 AI”:展示推理过程、要求用户先尝试、设置适度障碍。
- “防外包”机制可能成为卖点。例如强制间隔练习、苏格拉底式追问、生成后要求用户复述或解释。但这类设计需要新的商业模式支撑,不能只靠效率指标。
对个人学习者与工作者
- 建立“先草稿后 AI”的工作流。先自己写一版、推演一遍,再用 AI 补充或校验,而不是直接外包。
- 定期进行无 AI 练习。就像学生需要闭卷考试,成年人也需要“无 AI 日”或无 AI 任务,保持基础能力不退化。
- 把 AI 当对手而非答案机。用它来挑战自己的思路,而不是替代自己的思考。
对政策与研究
- 需要长期追踪研究。短期研究系统性低估 AI 的学习成本,政策制定不能依赖几周或几个月的实验。
- 高风险职业可能需要能力保持标准。医生、飞行员、程序员等岗位,应建立 AI 辅助下的能力评估与复训机制,防止“手艺生疏”。
一句话总结:AI 没有降低任何人的智商,它只是把“变聪明”的那道工序抽走了;而大多数成年人的工作,没有月考来暴露这一点。