本文来自微信公众号: 张考拉Clara ,作者:考拉Clara
这两天我是真的有点累。
原本以为只是让Codex帮我做一个小工具,把过去一年散落在微信朋友圈里的随笔批量采出来,整理成可检索、可复用的个人内容资产。
这件事看起来很适合交给AI:重复、枯燥、规则明确,属于典型的“人不愿干,机器正好接手”的活儿。
先说明一下,本次只采集我自己的内容,初衷也很朴素:少一点复制粘贴,顺便规避被微信风控误伤的可能。
但真正跑下来,我发现自己不是在做采集器,而是在被一个“看起来一直有进展”的AI项目拖着走。
版本号在涨,代码量在涨,文档厚度也在涨。上一版有漏洞,几分钟内就能复盘重构;我指出一个盲区,它立刻端出下一版方案。表面看,一切都在快速前进。
可连续两天真机调试后,我始终没拿到一个能稳定跑完全量采集的版本。
固定坐标频频失灵,OCR虽能识字,却分不清正文边界和日期归属,也无法稳定判断长文是否完整展开。页面滚动带来的漏采、重采,以及“这条到底采过没”的罗生门,更是层出不穷。
这些问题技术上并非完全无解,但我今天决定先按下暂停键。
原因不在于技术瓶颈,而在于我突然意识到:我差点被AI的“持续产出”骗了。
明明核心功能尚未跑通,项目却看起来一派繁荣,仿佛离终点只剩最后一公里。
直到冷静下来,我才惊觉自己混淆了三个截然不同的概念:代码写完,局部跑通,真机验证通过。
这三者之间,天差地别。
01
AI会把推断写成历史
这次经历,让我想起另一件小事。
当时,我在ChatGPT的一个长期内容项目里写文章。项目里已经存放了我的内容方向、写作风格和事实标准,我也在前一个聊天窗口里来回讨论了很多轮:文章写给谁,真正的新观点是什么,哪些角度虽然没错但不像我的风格。
第二天,我又开了一个新聊天,让AI接着做。
它很快给出一套完整答案。目标读者、核心问题、文章结构,甚至后续如何延展,都说得头头是道。
第一眼看,我几乎没察觉哪里不对。直到我继续追问“这条结论到底从哪里来的”,问题才慢慢浮出水面:有些确实是我们上次讨论过的,有些来自我长期设置的写作偏好,还有一些,只是AI根据现有信息自行补出的推断。
最后,它们却被写进了同一种语气里,仿佛全都是“我们之前已经定好的”。
这很像公司里来了一个很聪明的新同事。
他没参加上周那场会,但看过项目资料、会议摘要,也研究过你的工作习惯。你问他:“上次最后怎么定的?”他不会说“我没参会,只能根据材料判断”,而是很自然地接一句:“我们上次定的是……”
最麻烦的地方在于,他说的可能大部分都对。
“拿到了相关背景”,和“对某段历史的每个细节都有一手证据”,依然是两回事。
我把这种现象叫作“伪连续性”。
AI拿到一部分真实历史,再用长期偏好和推断把空白补齐,最终拼出一段非常连贯的过去。它不一定是在胡说。恰恰因为大部分内容都合理,那几处没有证据的补全,才更容易蒙混过去。
这种事情,其实不需要AI,真人世界里也天天发生。
开会时,有人随口提了一句:“这个方案后面也许可以这么做。”第一次,它只是建议。后来有人把它写进会议纪要,下周做PPT时,另一位同事又从纪要里摘了过去。再过一轮,新同事看到PPT,很自然地问:“这个不是之前已经定了吗?”
一句建议,就这样慢慢长出了“历史资历”。
最早是谁说的,有没有拍板,当时附带什么前提,反而越来越难追溯。
这也是长期AI任务比单次问答更麻烦的地方。
单次幻觉,污染的可能只是一个答案;长期任务里的错误,污染的可能是下一轮工作的起点。
一项关于大模型长程执行的研究,也观察到类似风险:当上下文中包含模型过去的错误记录时,模型后续更容易继续犯错。研究者把这种现象称为self-conditioning,也就是模型会被自己过去的错误记录继续影响。
这项研究不能解释我的采集器为什么失败,也不能证明“AI做久了一定会错”。
它只是给我观察到的“伪连续性”补了一条旁证:AI继续工作时,过去的记录本身就是下一步输入的一部分。
人也一样。如果新人拿到的交接单一开始就写错了,后面工作越认真,不一定离正确答案越近,也可能只是在错误起点上跑得更远。
所以,真正要警惕的不是AI没记住过去。
而是它记住了一段看起来很完整、实际上证据并不完整的过去。
02
进了企业,推断就会变成责任
我写文章、做个人工具,最坏的结果无非是返工,浪费两天时间,再承认这条路暂时没走通。
但AI一旦进入企业,性质就完全不同了。
因为企业里的很多话,不只是“表达”,还是流程、权限、成本和责任。
举一个最简单的场景。
假设一位消费者收到商品后发现破损,联系店铺申请退款。上一位客服留下的原话是:
“我先帮您提交退款申请,具体结果以售后审核为准。”
第二天,一个新的客服Agent接班。
它能看到消费者标签、聊天摘要、当前售后政策,也能看到过去类似订单的处理案例。这些信息可能都是真的:消费者确实申请了退款,客服确实提交了申请,类似订单过去也确实退过款。
于是Agent做了一个看似合理的推断:这一次全额退款大概率也能通过。
推断本身并不可怕。真正的分界线,出现在下一句话。
如果它把历史补成:“上一位客服已经答应为您全额退款”,性质就彻底变了。
“帮您申请”和“已经答应”,普通消费者不需要懂任何AI,也知道这不是一回事。前者是流程动作,后者已经代表店铺作出承诺。
这不是我随手想多了。
2026年8月,中国消费者协会发布上半年投诉分析时,明确提到涉及AI客服或通用型AI的投诉有所增多,集中在AI客服不实承诺、人工客服接入困难、生成内容失准等问题上。
人民网披露的一个案例里,某二手车平台官方AI客服“小瓜”告知消费者,2.87万元车款已包含过户费和上牌费。消费者支付2000元订金后,销售人员却要求另行支付1000元过户费,消费者由此发起投诉。

类似纠纷也在海外出现过。
加拿大航空曾因官网聊天机器人错误告知客户可在购票后申请丧葬折扣退费,被不列颠哥伦比亚省民事解决法庭裁定需承担责任。加航试图强调chatbot不是公司本身,但裁判思路很清楚:聊天机器人仍然是公司网站服务的一部分,公司不能简单把责任推给AI。
两条案例指向同一个问题:
当AI把推断写成事实,企业不能简单地用“那是AI说的”来免责。
一条推断,可以从AI回答进入摘要,从摘要进入交接记录,再从交接记录影响真实业务动作。更麻烦的是,如果这句话又被写进客服摘要,下一位客服、售后人员甚至消费者本人,都可能把它当成已经发生过的事实。
到这一步,问题已经不只是“AI答错了一句话”。
它开始触及企业的权限、成本和责任。
过去一年,很多企业都在搭建AI知识库。这当然重要。制度、SOP、产品说明、历史案例本身就混乱,Agent不可能凭空把一家公司的知识治理好。
但知识库只解决了一半问题。
公司员工手册可以写得非常清楚:正式员工一年有多少天年假,提前多久申请,什么情况需要上级审批。
可员工手册再完整,也不能证明“张三下周一这张请假单已经被批准了”。
前者是规则,后者是一次真实发生的业务决定。
同样,一套售后知识库可以告诉AI什么情况允许退款,却不能证明“这位消费者的退款已经批准”;历史订单可以告诉它某位客户过去拿过折扣,也不能证明“这一次销售已经答应同样价格”。
规则、建议、申请、批准、承诺,看起来只差几个词,背后承载的权力和责任完全不同。
所以Agent进入企业以后,一个关键问题会浮出水面:
它有权把什么说成“已经发生的事实”?
关键事实至少要能追得回来源:什么时候发生的,当前是什么状态,谁有资格确认,原始证据在哪里。
模型当然可以推断。
但它不能仅凭推断,把一项尚未发生的业务决定写成既成事实。
至于它能不能替企业“盖章”,取决于企业是否明确授予了它相应权限,以及最终由谁负责。
这也是企业级Agent落地时最容易被低估的一条边界:
知识库提供的是背景,不是授权;模型输出的是判断,不天然等于事实;自动化可以提效,但不能模糊责任。
03
AI越像同事,越需要一张靠谱的交接单
经过这两次踩坑,我也调整了自己和AI长期协作的方式。
现在进入一个长期任务,我更愿意先把“交接单”摊开:
这次实际拿到了什么材料?哪个版本有效?哪些结论有原始依据?哪些只是推断?上一轮做了什么验证?还有什么问题没有解决?
交接对不上,就先别急着往下跑。
我也开始刻意把三类东西分开。
长期稳定的规则是一类,比如事实边界、写作原则和权限要求;当前已经确认或否决的事实是一类;这一轮具体做了什么、怎么验证、还剩什么问题,则单独留在交接记录里。
这听起来很笨,却比一句“你应该记得吧”可靠得多。
朋友圈采集器还让我养成了另一个习惯:
写出来了,就只叫“写出来了”;局部跑过,就只叫“局部跑过”;没有在目标环境验证,就不要为了让项目看起来顺利,顺手把它升级成“已经解决”。
以前我会觉得这种表达太啰嗦。
现在反而觉得,这几个字最好一个都别省。
因为长期AI任务真正需要管理的,不只是任务本身,还有任务留下来的状态。状态一旦写错,下一轮工作就可能沿着错误起点继续往前跑。
有意思的是,AI公司自己在做长任务时,也开始依赖这些看起来很传统的项目管理常识。
OpenAI曾公开过一次Codex连续运行约25小时的实验。让这个任务保持可检查的,不只是模型能力本身,还有明确规格、阶段目标、里程碑验证,以及持续更新的项目记忆。OpenAI在复盘中也提到,Codex在每个里程碑后都会运行测试、lint、typecheck等验证步骤,并在失败时先修复,再进入下一步。
专门研究前沿AI能力的非营利机构METR,在评估Agent能独立完成多长任务时,也采用“任务时间跨度”这个指标。但他们也提醒,这类评测任务通常更自包含、更规则明确、更便于比较;真实工作会依赖过去的对话、隐性经验、既有代码库、团队协作,以及大量没办法自动打分的结果。
这恰好解释了我这两天的感受。
AI能跑更长时间的任务,不等于人终于可以把项目管理扔掉。
恰恰是它跑得更快以后,我们更需要知道:路标是谁写的,写的是什么,有没有验证过。
所以,长期任务里,“继续”从来不是答案。
验证,才是。
04
验证,才是继续的前提
这两天确实很累,采集器也没有按最初设想跑通。
但我不觉得这次折腾白费。
它让我更具体地意识到,未来AI走进真实工作,不只是模型变强、记忆变长、工具变多。还有一件看上去很不起眼的事,会变得越来越重要:
我们怎么管理它的“过去”。
过去,我们总希望AI像一个记性特别好的老员工,最好什么都记得,随时都能接上。
现在我反而更希望它像一个靠谱的新同事。
没参加过的会,就不要假装自己参加过;只看过交接材料,就把依据说清楚;没有验证过的结果,可以继续尝试,但别因为版本号往前走了,就顺手写成“已经解决”。
这不是要求AI变得保守,而是要求它对“事实”有边界感。
因为当AI能连续工作几个小时、几天,甚至更久以后,上一轮留下的每一句话,都可能成为下一轮的路标。
一块路标写错了,AI不会天然停下来。
它甚至可能沿着错误的方向,继续非常勤奋地跑。
所以,未来企业级Agent的成熟,不只看它能不能继续工作,也不只看它能不能调用更多工具、接入更多系统、完成更长链路的任务。
还要看它知不知道,什么不能被写成事实。
规则不能冒充审批,建议不能冒充决策,申请不能冒充批准,推断不能冒充承诺。
这才是我这次真正踩到的坑。
一个长期任务真正危险的地方,往往不是它彻底失败了。失败很诚实,红灯一亮,大家都知道该停。
真正危险的是,它一直在继续,看起来也一直有产出,但最关键的验证始终没有发生。
所以我现在更喜欢一句过去听起来不够“聪明”的回答:
“这件事,我没有足够证据。先别往下做。”
如果未来的Agent真的能学会这句话,我反而会更放心把工作交给它。
(文中配图均由AI辅助生成)
