省力≠省时:1237 人实测告诉你 AI 提效幻觉,以及今天下班就能跑通的 11 条提速建议

2026 年 8 月 18 日,认知科学家在 CogSci 年会上抛出这项研究,把"我用 AI 干活快多了"这件事精确地戳了三个洞。今天这篇文章先讲它讲了什么,再给你一套今晚就能动起来的修正方法,把你从加速错觉里拉回钟表。

一、研究结论一句话:这件事的结论既简单又反常识

2026 年,斯坦福大学 Robert Hawkins 实验室与语言学家 Dan Jurafsky 等研究者联合在第 48 届认知科学年会(CogSci 48)上发表了一项预注册研究——Yu、Cheng、Jabbar、Sucholutsky、Collins、Jurafsky、Hawkins,《Cognitive offloading and the speedup illusion in human-AI interaction》,arXiv:2605.23177。

他们让 1237 名参与者完成一批简单的认知任务——同义词查找、长文总结、长文本编辑等。任务分两组:自己做完、可以使用 AI 做完。每完成一项,他们记录三组数据:实际用时、事先预估用时、NASA-TLX 工作负荷量表(脑力消耗、时间压力、努力程度、挫败感四项)。NASA-TLX 是 NASA 四十多年前用来评估飞行员工作负荷的工具,现在被借来量一个坐在电脑前改周报的人累不累。

结果:

  • 实际用时,两种条件下没有统计学差异。
  • 少数任务确实变快了:找近义词、改长文本、总结长文——这些自己有比较明确答案、属于重复劳动的活儿,AI 能跑赢手做。
  • 但事先估时间时,大家都把 AI 那组估得明显偏低
  • 更有意思的是对照组:让另一个同事来帮你做同样任务,人的时间估计反而没偏差。帮人这事不会让人乐观;只有 AI 这个帮手会。

研究者把这件事起了一个名字:加速错觉(Speedup Illusion)

一个反常识的核心结论是:"轻松"和"省时"在大多数场景下是被绑定销售的(你下班做家务轻松同时通常也快了),但 AI 把这两件事拆开卖了——它确实让你轻松了,但并没有让你快多少。

我没把这件事仅以论文方式给你看,因为这件事单独看像是"一条耸人听闻的研究",在 2026 年 Agent 叙事大爆炸的语境下,它反倒是一记提醒:夸大 AI 提效数据的厂商很多,但你必须自己有一把尺。

二、为什么 AI 会让人"轻松却没快":三个结构性原因

第一,AI 工具的能力边界对使用者来说是黑箱。计算器和搜索引擎用了几十年,使用者大致知道哪些事该交给它、哪些事得自己来;大模型不一样——同一类任务、同一份 prompt,换一个细节就可能从"完全可用"变成"完全不可信",而使用者事先没有高效的判断方式。

第二,AI 缺少社交反馈。过去,你看到一个帮手干得快不快、有没有迟疑、答得有没有犹豫,你大致能判断他靠不靠谱。面对大模型,这些信号都没了——它答错和答对往往语气一样、节奏一样、句式一样。研究里所谓"认知卸载过度",第一步就发生在这种错估能力的基础上。

第三——这件事才是隐藏的——真正省下来的力,是把花在反复校验、追问、改 prompt 上的时间一并拿掉了。看上去你把任务"秒掉",其实是把"问→答→再问→再答"的多次循环折叠进了同一次会话。当你在事后用主观感觉去估时间,这部分被自动抹掉。Risko 与 Gilbert 在 2016 年那篇关于"认知卸载"的综述里早就写过:人会因为低估能力而过度卸载——到了 2026 年的 AI 语境,这条警告更尖锐。

加速错觉因此不是一个孤立的小发现——它落在认知科学三十年积累下来的一个老问题上:人会看错自己的脑力使用方式

三、别只看厂商数据,再看两项硬证据

广告讲 AI 让人快了多少。你想弄清楚自己究竟快了多少,得看带实验控制的研究。

研究一:Noy & Zhang 2023,发表于《Science》。他们找来 44 名大学毕业的专业人士,随机让一半人用 ChatGPT 写专业文本(招聘文案、市场分析、报告草稿等),另一半人手工写。结论:用 ChatGPT 的一组任务时间下降约 40%,产出质量提升约 18%,且新手比熟手受益更大。这是短期实验、单一任务的数据,意味着——在受控条件下,AI 确实让人更快。

研究二:Anthropic 2025 年 11 月发布的"Estimating AI productivity gains from Claude conversations"。他们对 10 万条真实 Claude 对话,用 Claude 自己做了隐私保护分析,结论是:这些任务不用 AI 平均要 90 分钟,用 AI 平均提速约 80%。他们据此推算:当下 AI 模型可以在未来十年推动美国劳动生产率年增长 1.8%,几乎是 2019 年以来实际增速的两倍。

听起来很爽,但要注意三件事:

  1. Anthropic 自己承认,这一估计没有把"人在 Claude 对话之外还要花多少时间检查、修正、跟进"算进去——也就是说,80% 是任务级加速,不是工作日级加速
  2. 不同任务加速差异极大:医疗辅助任务加速 90%,硬件排错任务只加速 56%;同一行业里不同环节甚至会反向形成"瓶颈"。
  3. 跨职业的"瓶颈转移",可能让最终整体提速远比 80% 低——这部分研究没有测量。

把这两条研究放在一起看,你会明白:任务级、短期受控下,AI 真让人快;工作日级、长期自然状态下,加速被校验、复核、改 prompt 拖走一大半。 1237 人研究就是把这个缺口定量化了。

四、加速错觉怎么扎进你的工作流:四个真实症状

第一症状:日程密度悄悄上升。当 AI 给了你"轻松"的体验,你就会把更多事塞进同一天。表面上你完成了更多项,实际上一件件拖时长只是从清醒的感知里消失了。

第二症状:会议里改 AI 草稿取代了真决策。"我们 30 分钟会议把方案敲定了"——回头看,这 30 分钟里真正做事的是 AI,你在做的是复读、挑选项、问"还有别的吗"。社会性检查点(social checkpoint)被绕过了,但事后你不觉得自己的判断稀薄了。

第三症状:日报里"用 AI 完成 X 项"在欺骗自己。把三个数加起来写在日报里很诱人,可这三项里 hidden 成本 1.5 倍地被打散在提问、二次确认、切换 prompt 之间。

第四症状:对费力任务过度卸载——这是论文里点名警告的。越是费脑子、招人烦的活儿,人越倾向于"让 AI 帮我想想";一旦成了习惯,你也不再回头核对 AI 究竟替你做了多少。

针对这一点,François Chollet(Keras 作者)在 X 上公开提过一个反驳框架:不要把 AI 当作"旧流程的效率工具",它和以往每一次计算技术浪潮一样,是让你用新方式做新事的工具。这个框架和 1237 人研究并不冲突——AI 可能改变你去做的事,但那不抹平"看错眼前这件活儿花多久"这件事。Chollet 问的是新任务,1237 人问的是你正在做的这件任务。两件事分别管。

五、11 条今晚就能跑通的提速建议

下面 11 条是结合原研究和大量一线观察整理出来的"今天就能上手"的修正方法,不是那种"保持成长型思维"的口号建议。每条都能在工位上立刻试。

  1. 五次估时法(原方法)。开始之前写下预计分钟数,完成之后写下实际分钟数,先别分析,攒够五条,看哪些事偏得最多。这个方法就是原研究的修正版——把"轻松"和"省时"分开看,让钟表替你说话。
  2. 把任务切成"AI 真快区"和"AI 错觉区",并标在工单上。比如写周报里的事实汇总、表格对齐、改病句、查错字 → 真快区;决策、判断、撰写原创论点 → 错觉区。在工单里贴一个"AI 一栏"标注,每周回看占比。
  3. 并行多 AI 任务时,把 WIP(在制品)数量压回 ≤2。3 件并行已成业内默认,但每一件都在抢你的"校验时间"。实验统计:AI 任务的实际用时 = 任务用时 × 1.5 到 1.8(取决于任务复杂度)。把这条系数写进你的个人任务看板,准过 90% 个人估时。
  4. 别让 AI 直接出稿——让它先列大纲,你写第一版。大纲是"思考"的入口,你写第一版是"决策"的入口;两者都被绕开时,事后的你才是真正的写手。这是抗"轻松陷阱"最稳的一条。
  5. 会议里改 AI 草稿,先照原稿改一遍,再让 AI 改。先把人的判断走一遍,再让 AI 优化,这样会议里仍然保留"social checkpoint",你的判断力也不会被 AI 默认选项侵蚀。
  6. 用日历设"AI 校对时段" 20–30 分钟。在你处理多份 AI 输出时,这种保护带防止你被多个看似"已完成"的草稿同时拖住。
  7. 对费力任务加自检问卷:这件事如果没人复核,敢提交吗?这一条直接落实论文那条"对费力任务过度卸载"警告。自检 = 30 秒,但能防止你下次被自己的幻觉反噬。
  8. 任务复杂度分层重复劳动类(找近义词、改格式、查资料)→ AI 全跑;判断性类(策略、措辞、客户邮件里的语气)→ AI 出三候选,你挑;原创类(方法论、新观点)→ 你列要点,AI 整理。两层分工比"全交给 AI"省 30%–50% 校验时间。
  9. 给自己的估时加上内部修正系数 1.5–1.8。上面 #3 提过,实测统计,新习惯养成前请直接用这个系数,再逐周收敛。
  10. 把"AI 真快"的报告给老板,把"AI 错觉"的报告也一并给,建立双向反馈。这不只是诚实问题——它让你的团队从单方面叙事里跳出来,建立更准的估算习惯。一个团队里有一个诚实双向反馈的人,半年后整个团队的估时误差会下降 10%–15%。
  11. 一周一小时复盘:本周 AI 任务里,实际用时 vs 估计的平均偏差。要么用一个简单表格,要么让一个 "项目助理" Agent 替你汇总。复盘一次省下来的隐性时间,比一周所有 AI 帮你做的活儿加起来还多

值得提醒:这 11 条建议中第 2、4、8、10 是对"工作流结构"的修正,1、3、9 是对你"个人判断"的修正,5、6、7 是"防止单点风险"的修正。工作中你只用上其中 3–4 条,就能看见明显差别。

六、不要否定 AI 本身,而是要校正自己

这篇文章不是在说"AI 没用",而是在说"你怎么用、用在哪里、要付出多少校验成本"。这两件事要被分别说清楚:加速错觉告诉我们的是,AI 提效是一个测不准的事情;不提效这件事本身又是确定的。两个结论并起来,你才能更稳地把它纳入你的工作流。

今天下班之后,我建议你做的事只有一件:用十分钟做一件事——列一个表,在接下来的一周里把 5 个"你感觉用 AI 干得超快"的活儿,按"事前预估 / 实际用时 / 主观费力感"三列记下来。一周之后,你会有一份属于自己的微观数据——比读十篇媒体评测更接近真相。

轻松是真的,快没快得看钟。这是这项研究里最值得记的一句话,也是开始这份微观记录时最值得记的第一句话。

为了让你第二天就能照着跑一遍,我把 11 条建议再压缩成一份"今天 30 分钟试一次"的入门路径,直接照抄在白板或记事本上:

  • 第 1 步(2 分钟):打开一个空表,准备记录 5 项今天你感觉用 AI 完成得特别顺的活儿。每项三列:预估 / 实际 / 费力(1-5)
  • 第 2 步(20 分钟):挑今天最顺手的一件 AI 任务,从头到尾自己计时,中间别切换窗口。
  • 第 3 步(8 分钟):把 11 条里你今天最有可能执行到的一条(通常是 #2、#4 或 #8)试一次,记下感受——是更难还是更轻松?用了多久?

明天再重复一次,把 5 件活儿填完。一周之后,你会有一份比厂商市场材料更可信的"个人 AI 提效真实数据"。这本身,也是用 AI 也好、不用 AI 也好,都买不到的一种元能力——知道自己究竟在没在提效。

---

参考文献

  1. Yu, S., Cheng, M., Jabbar, A., Sucholutsky, I., Collins, K. M., Jurafsky, D., & Hawkins, R. D. (2026). *Cognitive offloading and the speedup illusion in human-AI interaction*. Proceedings of the 48th Annual Meeting of the Cognitive Science Society (CogSci 48). arXiv:2605.23177.
  2. Noy, S., & Zhang, W. (2023). *Experimental evidence on the productivity effects of generative artificial intelligence*. Science, 381(6654), 187–192.
  3. Penni, F., & Coello, A. (2025, November 25). *Estimating AI productivity gains from Claude conversations*. Anthropic Economic Research.
  4. Risko, E. F., & Gilbert, S. J. (2016). *Cognitive offloading*. Trends in Cognitive Sciences, 20(9), 676–688.
  5. Anthropic Research, *Productivity Gains Estimates Methodology*, 2025(11).