**AI Agent自主判断并推进业务时,企业原有数据、规则、权限和流程未同步改造,导致“AI说可以退款但后台无法执行”等摩擦;释放Agent生产率的关键在于重新设计任务链和授权链,而不只是把AI装进旧流程。** **要点** **1. AI Agent引发服务链条断裂** AI给出明确报价但销售人员执行另一套规则,AI判断符合退款条件但后台系统无法执行,根源在于企业业务流程、权限和责任体系仍围绕人设计,未随AI自主判断能力同步调整。 **2. 淘宝两次实验揭示升级分界线** AI助手(只提建议,人决策)使低绩效客服效率提升,用户不满意比例下降3.4%;AI Agent(自主接待用户)处理时间下降16.8%,但用户评分下降0.412分——更快不等于更好,旧流程中的摩擦和交接成本反而暴露更早。 **3. 任务链与授权链决定Agent实际效果** AI能连续执行相邻步骤时自动化收益易释放,但企业需要将隐性经验整理成可检索规则、拆分数据权限、设计人工介入节点和责任追溯机制。任务链决定AI能走多远,授权链决定企业敢让它走多远。 **4. 企业需重新设计流程而非仅安装新工具** 电气化初期工厂只换电机不改变厂房布局导致生产率滞后。类似地,AI Agent需要企业重新梳理数据、业务规则、权限和异常处理,把历史经验转化为AI可读的规则和权限,否则历史积累只是包袱而非资产。
把500元退款交给Agent之后
2026-08-26 20:04

把500元退款交给Agent之后

本文来自微信公众号: 防冷涂的腊 ,作者:防冷涂的腊


今年5月,龚先生在一家二手车交易平台询问一辆车的费用。平台官方AI客服“小瓜”给出的答复很明确:2.87万元报价已经包含过户和上牌费用。得到这个答案后,龚先生支付了2000元定金。等到线下办理手续,销售人员却又要求他支付1000元过户费。


AI说费用已经包含,销售说还要另付。对消费者来说,麻烦不只在于多出1000元,而在于他已经根据平台给出的答案付了定金。


这类纠纷正在改变AI客服问题的性质。过去的主要问题是听不懂、答非所问、不肯转人工。现在,AI开始进入价格、退款、赔偿和处理资格等真实业务。它不只需要给出一个听起来合理的回答,还要把回答变成企业能够执行的处理结果。


矛盾也从这里出现。AI认为用户符合退款条件,后台系统却无法退款;AI给出明确报价,销售人员却执行另一套规则;AI已经把会话推进到下一步,人工接手后又要从头确认。模型能够完成的工作越来越多,企业原来的数据、规则、权限和人工流程却没有同步改变。


如果AI只负责给客服提供建议,这些问题还可以留给员工处理。当AI开始自己判断、调用系统和推进任务,原来围绕人设计的流程就会不断出现摩擦。


淘宝客服的两次现场实验,正好展示了这条分界线:同样是AI进入客服,一个主要提高员工效率,另一个已经开始改变整条服务流程。


01两次AI进入客服的实验


第一次实验中,AI坐在客服旁边。


2024年1月至2月,研究者把5940名入职不满一年的淘宝客服随机分组,观察约256万次会话。实验组的工作台上多了一名生成式AI助手:它识别用户的问题,查找相关资料,再给出一个解决方案。客服可以直接采用,也可以修改或忽略。


结果很快反映在工作效率上。客服识别问题的时间平均下降8.2%,会话时长下降1.1%,用户“不满意”比例下降3.4%。低绩效客服改善更明显,AI把资深员工掌握的知识更快送到了经验不足者面前。


在这个实验里,AI几乎没有改变企业原来的权力关系。它可以建议“这类订单适用哪条规则”,却不能替客服决定是否退款;它可以生成回复,发送按钮仍由人来点。SOP、审批权限和责任归属都没有变化,企业只是在原来的工作台里增加了一个更好用的工具。


这一阶段,AI提高的是人的生产率。


几个月后,第二次实验里的AI换了位置。它不再坐在客服旁边,而是自己开始接待用户。


2024年8月,647名客服参与了一项为期17天的Agentic AI实验,共覆盖约68万次会话。系统先识别适合标准化处理的问题,再由AI继续推进会话;每次会话仍匹配一名人工监督者,但人工退到了后台,只有系统触发或客服主动介入时才接手。


实验最终只有约5.8%的会话进入AI可处理范围。在这些会话中,处理时间下降约16.8%,用户评分却下降约0.412分。速度和评分走向不同,说明AI把会话更快推向结束,并不等于用户的问题已经被更好地解决。


这两项实验中,第一项实验里,AI提出建议,人判断、执行并负责;第二项实验里,AI开始理解、判断和推进,人工负责监督与异常接管。


AI助手改变的是一个岗位,Agent开始改变一条流程。


为什么从岗位走向流程以后,难度会突然上升?这并不是客服行业才有的偶然摩擦。企业采用通用目的技术时,类似的时间差已经发生过一次。


02一百年前,工厂先换了电机,后来才改变生产


蒸汽时代的工厂里,通常有一台大型动力机放在厂房中央。动力沿着传动轴送到不同楼层,再通过皮带带动每一台机器。机器不能随意摆放,离轴太远就难以获得动力;厂房的楼层、设备的位置和工人的分工,都围绕这套中央动力系统设计。


电动机出现后,第一批工厂主没有立即推倒厂房。更省事的做法,是把蒸汽机换成电动机,其他部分继续使用。动力来源变成了电,传动轴还在,皮带还在,机器的位置没有动,生产组织也没有动。新技术进入了工厂,工厂却仍按蒸汽时代的方式运行。


经济学家Paul A.David研究电气化历史时,强调的正是这段容易被忽略的过程。早期采用电力,并没有马上带来后来人们熟悉的生产率跃升。等到单机驱动逐渐普及,每台机器可以独立获得动力,企业才有条件拆掉中央传动体系,重新安排设备、物料流动、厂房结构和岗位。更大的效率改善,来自围绕电力重新设计生产,而不只是换掉动力机。


几十年后,Erik Brynjolfsson等人把这类滞后概括为“生产率J曲线”。一项通用目的技术投入企业以后,成本往往先发生:企业要建设新软件,清理数据,培训员工,调整流程和组织方式。这些配套资产需要时间形成,收益却要等新流程稳定运行后才释放。生产率可能先下沉,再向上抬升,曲线因此像一个字母J。


生成式AI已经出现类似迹象。微软参与的一项随机实验覆盖66家企业、7137名知识工作者。使用Copilot 12周后,员工每周处理邮件的时间平均减少1.4小时,降幅约12%;但会议时间、写作时间,以及邮件线程、会议和文档数量没有显著变化。个人能够独立改变的活动先变快了,多人协作和企业整体工作方式却没有同步改变。


这也解释了两次淘宝实验之间最关键的差别。AI助手只改动一个员工完成某个节点的方式,原流程基本可以继续运行。Agent要把任务往下推进,就会遇到后台数据、业务规则、系统接口、人工接管和责任划分。模型越快,旧流程里的等待和摩擦反而暴露得越早。


把新技术装进旧流程,和按照新技术重新设计流程,是两件不同的事。


那么,Agent究竟要求企业重新设计什么?不妨回到开头那笔退款,看看AI要把一句“可以退款”变成500元到账,中间到底隔着多少工作。


03从一句“可以退款”,到真的退回500元


客服软件过去也会自动处理问题,只是它获得的判断空间很小。菜单客服让用户自己选择选项,系统执行固定动作;规则引擎按照预先写好的条件运行;生成式AI助手可以理解自然语言、查资料和推荐方案,最后仍由员工决定。到了Agent,软件开始读取真实业务数据、选择规则并调用系统,才真正靠近企业的业务权限。


图1|客服技术演进的实质,是判断权和执行权逐步向软件移动。


现在假设一名用户说:“我要退款500元。”AI要完成这件事,至少要识别用户在投诉什么,找到对应订单,确认付款和履约状态,查询当时有效的退款规则,判断用户是否符合条件,选择原路退回还是其他方式,执行退款,告诉用户结果,最后把处理过程写进工单。


这不是一个任务,而是一串前后相连的任务。前一步给出的结果,会成为后一步的输入。订单找错了,后面的规则判断全部失去意义;退款已经发起却没有写入工单,下一名客服还可能再次操作。


很多企业现在的AI流程看起来已经覆盖了不少环节,真实工作却仍是另一番样子:AI识别问题,人确认类别;AI找到规则,人决定方案;AI生成回复,主管审批;最后再由系统退款。完整流程依然是“AI—人—AI—人—系统”。


假设AI只用几秒钟就找到了规则,但500元退款需要主管批准,而主管正在开会。前面节省的时间会全部停在审批节点。等主管上线,他还要重新阅读对话、核对订单和理解AI的建议。一次交接增加一次等待,也增加一次上下文丢失和口径偏差。


这就是任务链的问题。2026年NBER论文《Chaining Tasks,Redefining Work》把生产过程拆成有先后关系的步骤。研究的核心启发是:AI能够连续执行相邻步骤时,自动化收益更容易释放;如果它会做的环节零散分布,边界和交接会压低实际执行率。这项研究不是适用于所有行业的因果定律,但它抓住了Agent部署中一个长期被忽略的变量。


图2|Agent的目标不是取消人工,而是减少常规步骤之间的人机交接。


淘宝Agent实验中,只有5.8%的会话进入AI可处理范围,也可以放到这条链上理解。在当时的模型、规则和风险边界下,企业能够放心交给AI连续处理的会话仍然很少。想扩大这一范围,模型需要回答得更准,企业也要把查询、判断、执行和记录这些相邻任务真正接起来。


企业AI的生产率,不取决于有多少环节用了AI,而取决于AI能连续干多长。


一个自然的反问是:既然交接会损失效率,让AI把整笔退款自己做完不就行了吗?


问题是,它首先得拿到公司的权限。


AI要核对退款,第一步是看到真的订单:用户是否已经付款,订单处于什么状态,有没有发起过退款。如果客服系统显示“已退款”,支付系统仍显示“处理中”,模型再强,也只能在互相冲突的事实中猜测。企业还要决定它能读取哪些字段,用户等级、历史投诉和支付信息是否需要脱敏。数据首先决定,AI和企业是不是在面对同一个事实。


订单确认以后,AI要知道公司真正执行的规则。很多规则并不整齐地放在一本SOP里,而是散落在培训资料、系统提示、临时通知和主管经验中。员工看到“特殊情况酌情处理”,可以结合过往案例理解;Agent要稳定执行,必须知道什么算“特殊”,谁有资格酌情处理,新旧通知冲突时哪一版有效。企业需要把隐性经验整理成可检索、可判定、可更新的规则。


接下来才是最关键的一步:AI必须真的有权退这500元。


它告诉用户“按照规则,你符合退款条件”,风险还停留在信息层面;它告诉用户“500元已经原路退回”,就已经调动了企业资金。企业需要明确,100元能否自动处理,500元是否需要二次验证,5000元是不是必须由人工审批;涉及金融、安全或法律责任的业务,是否直接禁止AI自主执行。权限还要落到具体动作,不能只是给模型一个可以进入后台的账号。


Agent开始进入企业内控。


权限也不是越大越好。成熟的Agent还要知道什么时候停止。订单信息不一致、模型置信度不足、用户情绪恶化、金额过高、疑似欺诈或已经超出规则边界,都应触发不同级别的人工接管。淘宝实验已经说明,后台留着一名人工,不等于人机协作已经成立。介入发生得太晚,客服接手后还要重新询问,用户只是从和AI争执变成再向人解释一遍。


500元退回以后,流程仍没有结束。企业还要能够回答:AI为什么批准退款,读取过哪些数据,依据哪一版规则,谁给了它这项权限,资金是否真的到账,错误能不能撤回。2024年加拿大一宗机票差价纠纷中,Air Canada试图把错误信息归因于网站聊天机器人,加拿大民事裁决法庭没有接受这一解释。机器人属于企业网站的一部分,企业仍要为它提供的信息负责。这个案例没有替所有Agent纠纷给出统一法律答案,却把责任边界说得很清楚:企业不能把软件当作独立于自己的发言者。


让AI真的做事,企业就要告诉它能看什么、依据什么、能决定什么、什么时候停,以及出了问题如何追查。这些内容共同组成授权链。


到这里,两条链可以放在一起看。任务链决定AI能连续完成多长的业务;授权链决定企业敢让它连续完成多长。Agent每往前多走一步,通常都要获得更多数据和执行权限;权限越接近真实资金与资源,企业对规则、异常处理、审计和责任的要求就越高。


任务链决定AI能走多远,授权链决定企业敢让它走多远。


这套矛盾会不会只是客服行业的特殊问题?换一个部门,答案很快就会出现。


04客服之外,采购会遇到同一条边界


客服最早暴露Agent的问题,有很现实的原因:业务高频,流程相对标准,历史数据多,人工成本和结果都容易衡量,而且直接面对用户。AI只要答错一句话,结果很快就会变成退款、投诉或重复咨询。


这也提醒企业调整评价方式。传统呼叫中心习惯看平均处理时长、接待量和人工成本。淘宝实验中,AI自主处理的会话确实更快;如果用户随后再次咨询或投诉,局部效率只是把成本挪到了流程后面。Agent承担的任务越长,指标越要接近完整结果,例如问题是否一次解决、人工接管是否有效、错误能否回滚,以及每个已解决问题的总成本。


如果把场景换成采购,问题没有本质区别。AI帮助采购员总结供应商资料、整理报价和生成询价邮件,不需要改动原来的审批关系,它仍然是助手。采购Agent真正开始工作,则要发现库存变化,判断是否补货,联系供应商,比较报价,选择方案并提交采购单。


流程一旦往后推进,客服里的问题会依次重现。它可以看到哪些库存和成本数据?最多能花多少钱?新供应商由谁审核?报价突然偏离历史区间时,是继续下单还是交给人?采购员过去依靠经验完成的判断,需要变成Agent可以调用的规则;企业原来交给岗位的采购权限,也要拆成金额、品类、供应商和风险等级。


如果每一步都重新交给人审批,风险看起来降低了,Agent也会退回助手的位置,连续流程的效率无法兑现。更可行的做法,是先选择一段规则稳定、数据可用、结果可回滚的任务,让AI连续处理,人负责设定边界和接管异常。等错误率、交接质量和审计记录稳定后,再逐步增加任务长度和授权范围。


客服只是先行实验,其他业务也会遇到类似边界,区别只在风险和授权强度。


05没有旧流程的公司,就一定更快吗?


看到这里,一个很有力的反问是:既然成熟企业改造旧流程如此麻烦,AI原生公司是不是天然占优?


AI原生公司可以从第一天按“AI处理标准任务、人工处理异常”设计软件和岗位,少了旧系统与旧审批链的阻力。任务链更容易连起来,权限也可以在建设初期拆清楚。


但Agent稳定工作还需要另一类资产:长期业务数据、成熟规则、风险经验和足够多的异常案例。新公司没有复杂的历史包袱,也缺少这些沉淀。Agent最容易在少见、模糊、代价高的边界上出错,恰好需要真实业务反复积累。


成熟企业的问题相反。旧软件、部门边界和审批结构会拖慢改造,背后却保存着长期客户记录、真实业务数据、行业规则和大量失败案例。只是这些经验不会自动成为AI能力。规则继续留在主管脑中,数据仍分散在不同系统,异常处理只靠老员工口口相传,再丰富的历史也无法被Agent调用。


竞争因此不只取决于谁的历史包袱更少,而在于谁能更快完成转化:AI原生公司要把业务经验补起来,成熟企业要把已有经验从人、SOP和旧系统中拆出来,变成AI能读取的规则、能安全使用的权限,以及人与AI能够共同执行的流程。


历史积累只有被转化成规则、权限和流程,才会从包袱变成资产。


06企业要重新设计的,不只是一套客服系统


从一句“可以退款”到500元真正到账,中间隔着订单、规则、权限、异常处理和审计。模型能够生成这句话,只说明它会回答;企业能够把这句话稳定地转化为一项可以执行、可以追溯的业务动作,才说明适合Agent工作的流程已经建立起来。


过去几十年的企业软件,大体建立在一个前提上:人理解情况并作出判断,软件负责记录和执行。ERP、CRM、OA和财务系统里的表单、按钮与审批流,都围绕人来设计。AI助手没有改动这个前提,它只是让人更快获得信息和完成表达。


Agent开始改变这套分工。越来越多标准业务可能变成:人设定目标、规则和边界,AI完成判断与执行,人处理异常。企业要重新梳理数据和业务规则,拆分权限,设计连续任务,确定人工介入节点,并建立能够追溯和回滚的责任体系。模型只是进入企业的入口,真正困难的改造发生在后台系统和组织内部。


真正决定这一轮AI生产率的,可能不是谁最早部署最强的模型,而是谁最早把自己的企业重新设计成适合AI工作的样子。

频道: 商业消费
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP