AI Agent时代,拥有操作资格与执行操作本就是两件不同的事,抹平能力与执行之间的边界会带来安全风险,需重建独立的执行控制边界。 ## **1. 日常门锁藏着四层清晰的权限执行结构** 开门包含拥有钥匙、锁接受钥匙、转动钥匙、门打开四个独立层次,体现出拥有资格与决定执行之间天然存在距离。 ## **2. 数字世界发展持续压缩能力与执行的边界** 过去三十年数字系统追求效率,将身份验证、权限授权与执行三个环节逐步压缩成连续动作,最终执行环节原本由人工把控。 ## **3. AI Agent抹去了人工把控的最终执行环节** AI Agent可自主完成整条操作链,直接替用户完成最终执行,拥有权限不代表本次执行正确,合规前提下仍可能产生错误结果。 ## **4. 合理的执行边界无需增加人工确认** 真正的执行控制是在最终执行前设置独立判断层,检查本次执行的对象、参数、环境是否符合要求,无需逐次人工审批。
钥匙插进锁孔之后,为什么还要转一下?
2026-08-08 13:08

钥匙插进锁孔之后,为什么还要转一下?

本文来自微信公众号: HavenlonLabs ,作者:Havenlon Labs


——AI Agent时代,最被低估的那一道边界


我们每天都在开门,却几乎从没认真想过一个极其普通的问题:


为什么钥匙插进门锁以后,门不会自动打开?


钥匙已经在你手里,它能顺利进入对应的锁芯。在绝大多数日常场景里,这已经足够说明一件事:你拥有打开这扇门所需要的全部凭据。


但事情并没有结束。


你还需要握住钥匙,转动它,让锁芯发生一次明确的机械运动,带动锁舌退出,最后再推开门。


整个过程可能只有一两秒,短到我们从来不会把它拆开来看。可如果把这一两秒放慢,会发现人类其实早就在一把最普通的门锁里,留下了一种非常成熟的系统设计:


证明你有资格做一件事,和真正让这件事发生,从来不是同一件事。


这听起来像一句废话。但进入数字世界之后,我们恰恰越来越容易忘掉它。


一、一把门锁里,其实藏着四层结构


钥匙首先是一种凭据。它回答的问题是:你有没有进入这套机制的资格?


但拿着钥匙,并不等于门已经打开;把钥匙插进锁里,也不等于门已经打开。只有当钥匙与锁的条件匹配,并且随后发生一个明确的机械动作,锁的状态才真正改变。


这里实际上存在四个彼此独立的层次:


  • 你拥有钥匙;


  • 锁接受这把钥匙;


  • 你决定转动它;


  • 门真正被打开。


在日常生活中,我们不会把它们混为一谈。一个人拿着办公室钥匙站在门口,不意味着办公室已经开放;一个人把钥匙插进家门,也不意味着他已经决定进入。


甚至很多时候,我们会把钥匙插进去以后停顿一下,再决定究竟要不要打开。


这种停顿非常不起眼,却揭示了一件重要的事情:


拥有能力,与决定使用这种能力之间,本来就存在距离。而真正改变现实的,发生在这段距离之后。


二、数字世界的三十年,一直在试图消灭这段距离


计算机系统的发展,很大程度上是在追求效率——准确地说,是在追求"少一步"。


输入密码以后,希望立刻登录。刷脸以后,希望门立即打开。授权一个应用以后,希望后续操作尽可能自动完成。API拿到了Token,就可以调用服务。程序获得了管理员权限,就可以执行管理员能执行的一切操作。


从体验角度看,这当然越来越方便。但与此同时,一个原本清晰的边界也在逐渐消失:


Authentication、Authorization和Execution,正在被压缩成一个连续动作。


证明了"你是谁",很快就变成"你能做什么";证明了"你能做什么",又很快变成"那就替你做了"。


系统运行得越来越顺滑,三个原本不同的问题也越来越容易被当成同一个问题:


  • 你是谁?


  • 你有没有资格?


  • 这一次,事情究竟应该不应该发生?


在过去三十年的软件世界里,这种压缩通常问题不大。因为大多数软件最终只是给人提供工具,在真正改变现实之前,往往还有一个人坐在屏幕前,点下那个"确认"。


过去三十年,软件的最后一公里,一直是由人类走完的。


可AI Agent出现之后,这个结构开始改变。机器不只是帮助我们操作软件,它开始替我们完成整条操作链。


于是那个曾经被人类自然承担的最后动作,正在无声地消失。


三、真正值得注意的不是"钥匙",而是那一下转动


设想一扇非常奇怪的门:只要钥匙插进去,门锁立即弹开。


技术上完全可以做到。但我们的直觉会觉得这种设计有点问题。


因为"把钥匙放进锁里"这件事,可能只是为了确认钥匙是否正确,也可能只是一个准备动作。它不应该天然等价于——现在就把门打开。


这里存在一个非常细微、却极其重要的区别:


  • 钥匙描述的是一种能力;


  • 转动描述的是一次具体意图;


  • 锁舌退出,则是一个现实结果。


能力、意图与结果,从来不是天然相等的三样东西。


一个人今天拥有办公室钥匙,不代表他今天必须进入办公室。一个财务人员拥有付款权限,不代表账户里的每一笔钱都应该被支付。一个管理员拥有删除数据库的能力,不代表每一次删除请求都应该发生。一个AI Agent拥有调用支付API的权限,也不代表它计算出来的每一次付款,都应该自动进入真实世界。


于是那一下看起来毫无意义的"转动",其实承担了一件非常重要的事情:


把"我有资格",转换为"我现在明确要让这件事发生"。


这就是执行边界。


四、权限回答"可以",执行控制回答"这一次可以吗"


现代数字安全已经非常擅长回答前两个问题。


用户名和密码证明身份,证书证明设备,Token证明授权,IAM决定角色能够访问哪些资源,RBAC、ABAC和各种策略系统继续把权限切得更细。


这些机制都非常重要。但它们大多围绕同一个核心问题展开:


这个主体原则上有没有资格做这件事?


AI Agent时代真正麻烦的地方在于,这个问题开始不够用了。


因为一个Agent完全可能:身份是真的,权限是真的,Token是真的,调用的API也完全合法——但最终准备执行的那件事,仍然是错的。


它可能理解错了用户意图;可能选错了对象;可能算错了金额;可能使用了几分钟前就已经失效的上下文;也可能前面十个步骤单看都合理,组合到一起却产生了一个用户从未真正想要的结果。


这时候再去问"它有没有权限",已经没有太大意义。因为答案可能是:有。


Agent时代最危险的错误,往往不是越权,而是完全合规地做错一件事。


真正应该继续追问的是:


即将发生的这一次执行,在此刻、对此对象、以这些参数,仍然应该发生吗?


这就像门锁。问题不只是你有没有钥匙,而是——现在,要不要转动它。


五、AI最大的变化,是它开始替人完成"转钥匙"这一步


过去的软件通常停在钥匙之前。


它负责提供信息、整理数据、计算结果,然后等待人来完成最后一步。


AI Agent则不同。Agent存在的意义,恰恰是减少这些人工动作。


你告诉它:"帮我把这个事情处理掉。"


它自己拆解任务,自己寻找信息,自己判断路径,自己调用工具。如果权限允许,它还会自己完成最终操作。


从效率角度看,这正是Agent最迷人的地方。但从控制结构看,它意味着一个非常关键的变化:


过去负责拿钥匙的人,与负责转钥匙的人,正在变成同一个主体。


甚至更进一步——这个主体还负责判断该去哪扇门、选择哪一把钥匙、判断什么时候打开,以及打开以后继续做什么。


当理解、规划、授权与执行不断集中到同一个Agent身上,我们做的其实并不是简单地"让软件更自动化"。


我们是在重新分配执行权。


这也是为什么,AI安全如果仍然只围绕模型是否安全、账号是否安全、权限是否正确展开,最终可能是不够的。


因为真正发生变化的,从来不是"谁拿到了钥匙",而是:


钥匙与转动钥匙之间原本存在的那段距离,正在被自动化悄悄抹平。


六、好的自动化,不应该消灭所有距离


科技行业长期以来有一种非常强烈的工程直觉:


步骤越少越好,延迟越低越好,确认越少越好,能自动完成的,就不要让人再操作一次。


在大量低风险场景里,这当然是正确的。没有人希望每打开一个网页都确认三次,也没有人希望AI写完一句话,还要经过五层审批才能显示出来。


问题不在于自动化本身。问题在于,我们很容易把"减少不必要的摩擦",进一步理解成——所有边界都是摩擦。


但现实世界并不是这样运行的。


汽车刹车是一种摩擦,电梯门的安全检测是一种摩擦,银行卡每日限额是一种摩擦,危险设备的保护盖也是一种摩擦。


这些东西确实降低了某些意义上的效率。但它们存在的目的,本来就不是提高效率,而是确保某些动作,不会因为前面的条件已经满足,就不受约束地一路走到底。


所以一个成熟系统真正需要区分的是:


  • 哪些步骤只是低价值的流程;


  • 哪些步骤实际上承担着边界。


流程可以被自动化,边界不能因为自动化而消失。


这可能是Agent时代最容易被忽略的一个问题。


七、真正的执行控制,并不是重新增加一个"确认按钮"


一提到执行边界,很多人的第一反应是:那是不是以后每次AI操作之前,都要让用户重新确认一次?


并不是。


如果最后仍然要求一个人逐笔点击确认,那么Agent的意义确实会大幅下降。


真正值得设计的,不是更多人工审批,而是让系统能够在最终执行之前,重新独立判断:


  • 执行对象,是不是原来的那个对象?


  • 金额有没有超出边界?


  • 当前环境有没有发生变化?


  • 策略此刻是否仍然有效?


  • 前面的证据链是否完整?


  • 多个独立条件是否仍然同时成立?


  • 有没有任何一条规则,明确拒绝这一次执行?


换句话说,最后那一下"转钥匙",未必需要由人来完成。它完全可以高度自动化。


但它应该是一套与"拿到钥匙"完全不同的机制。这才是关键区别。


自动执行,不等于无边界执行。


真正成熟的Agent系统,甚至可能比人工操作更自动,但它依然会保留一个明确的执行控制层:


前面的系统负责理解,前面的系统负责规划,前面的系统负责授权;而在现实真正改变之前,还有最后一道机制,只负责回答一个问题——


这一次,是否真的允许发生?


它不需要重新理解整个世界,也不需要比AI更聪明。


它只需要拥有一项非常清晰的权力:在条件不成立的时候,不让锁芯转过去。


八、真正值得警惕的,是"有钥匙所以门就该开"


钥匙是一种非常古老的技术,古老到我们几乎不会再把它当成"安全架构"。


但正因为它足够简单,反而保留了一种极其清晰的边界感:


拥有钥匙是一回事,把钥匙放进锁里是一回事,决定转动它是一回事,门真正打开,又是另一回事。


人类并没有因为这几个动作彼此接近,就认为它们应该被合并成同一个概念。


数字世界却越来越喜欢这样做。我们把身份变成权限,把权限变成能力,再把能力直接连接执行。


在过去,这种设计带来了巨大的便利。但当软件开始拥有越来越强的自主判断能力,当AI Agent开始跨越金融、云平台、数据库乃至物理设备直接改变现实,我们可能需要重新把那些被效率压缩掉的边界,一点点找回来。


不是因为AI一定不可信,也不是因为自动化本身危险。而是因为一个非常朴素的常识:


证明一个主体有资格改变现实,与允许它在这一刻真正改变现实,本来就是两件不同的事情。


一把普通的钥匙,其实早就告诉了我们答案。


钥匙可以证明你拥有打开这扇门的能力,但门并不会因此自动打开。因为在"能够"与"发生"之间,始终还应该存在最后一个问题:


现在,真的要转动它吗?


也许AI Agent时代真正缺少的,并不是更聪明的钥匙,而是重新找回那一下看似多余、实际上决定现实是否改变的——转动。

频道: 社会文化
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP