**2026年起,Meta Muse、OpenAI Dots等产品开始让机器在用户离开后持续执行长期任务,计算机首次将“执行权”从界面中抽离。未来人机交互的核心不再是操作机器,而是委托、监督和收回机器的行动权。** **要点** **1. 执行权从界面抽离,人机关系从操作变为委托** 传统GUI让人逐步操作机器;Agent产品(如Microsoft Project Solara)让机器自主选择路径、调用工具、持续行动,人只在关键节点介入。界面任务从“操作机器”转变为“管理授权、边界和例外”。 **2. 责任单位从临时任务变为持续责任** 过去交互单位是Message和Task(执行完即结束);现在出现Responsibility(如“持续监控该领域”),状态变为Active、Suspended、Escalated、Revoked,要求人管理职责域、权限边界和升级路径。 **3. 控制权从过程控制迁移到策略与边界控制** 人不需操作每一步,而是定义目标、可接受代价、时间/金额/数据边界以及例外处理规则。以商务出差为例,传统需逐步订票,未来只需授权“按过往偏好处理,超3000元或涉及风险时问我”。 **4. 未来UI管理的不再是页面,而是一组新关系对象** 核心对象包括Goal(长期目标)、Authority(有限授权)、Trigger(何时主动行动)、Exception(权力交还点)、Verification(证据而非日志)和Recovery(撤销行动轨迹)。界面成为人类注意力路由器,只展示“正在推进什么、什么已变化、什么需你决定”。 **5. 多Agent时代界面将类似组织结构图** 当用户拥有多个常驻Agent,需管理角色、责任、预算、审批、例外升级路径。界面不再是App首页,而是显示“谁负责什么、拥有什么权限、在何处需要人介入”的组织视图。
当AI 开始替你行动,界面开始不再像界面
2026-10-02 00:28

当AI 开始替你行动,界面开始不再像界面

本文来自微信公众号: AIGC从0到1 ,作者:王零壹,原文标题:《当 AI 开始替你行动,界面开始不再像界面》


过去几十年,计算机界面一直在解决同一件事:


人怎样操作机器。


你打开App,找到功能,点击按钮,输入参数,确认执行。


你知道文件在哪,知道功能在哪,知道哪一步该由自己完成。


但2026年开始,很多新产品正在把这个前提一点点拿掉。


Meta Muse、OpenAI Dots、Microsoft Project Solara,以及一批企业Agent产品,表面上看依然有聊天框、卡片、侧边栏和设置页;但它们共同在做的事情,已经不是“给Chatbot找一个更漂亮的UI”。


它们开始让机器在你离开之后,继续替你行动。


OpenAI对Dots的描述非常直接:它是一个可承担持续责任、拥有云电脑、可跨连接应用工作的常驻Agent;Meta Muse也把长期目标、后台行动、跨应用执行和权限控制放进了同一个产品定义里。


这意味着,未来人机交互最重要的问题,是:


“机器什么时候可以替我行动?”


“它能做到哪里?”


“它凭什么这样做?”


“什么时候必须回来找我?”


“如果它做错了,我怎样把权力拿回来?”


这不是简单地UI风格的变化,这是计算机第一次开始把“执行权”从界面里抽走。


而未来界面的任务,也会从“让人操作机器”,变成“让人委托、限制、监督并收回机器的行动权”。


一、未来的电脑首页,可能只剩三件事


想象一下,几年后的某个早晨。


你打开电脑。


它不再先给你二十个App图标,不再先给你几百封邮件,也不一定先给你一个空白聊天框。


它可能只给你三类东西。


第一类:


我在替你推进什么。


“你的竞品研究正在进行,两个新的市场变化已经进入待判断状态。”


“客户流失预警已启动,有三位客户满足介入条件。”


“下周的商务出差已经完成初步安排,有一项航班选择需要你确认。”


第二类:


昨天什么发生了变化。


“竞争对手更新了定价策略,影响分析已生成。”


“项目预算减少10%,原计划中的两项工作被重新排序。”


“一个此前成立的研究假设,被新的数据推翻。”


第三类:


哪些地方必须由你决定。


“两个供应商都符合条件,但成本和交期存在取舍。”


“需要一次性付款2600美元,超过了当前授权上限。”


“任务看似完成,但系统无法确认订单是否真的提交成功。”


可以把它压缩成三个词:


Goals—Changes—Exceptions。


这看起来像一个更聪明的Dashboard仪表盘。


但它其实不是。


Dashboard的前提是:人看数据,再操作系统。


而这个新界面的前提是:机器已经在替人行动,人只在关键处重新出现。


这才是Agent Interface和传统软件界面的根本差别。


二、2026年发生的,不是Chatbot找到了下一种皮肤


如果只看视觉,这一轮变化很容易被低估。


还是输入框,还是聊天记录,还是文件上传,还是侧边栏。


但底层交互的基本单位,已经开始移动。


过去是:Message


你问一句,机器答一句。


接着是:Task


你不再问“这个行业最近有什么新闻”,而是说“帮我把这个行业过去三个月的重要变化理一遍”。


机器会自己搜索、筛选、调用工具、保存中间状态、整合信息,然后过一段时间把结果交回来。


再往前一步,正在出现的是:Responsibility责任


不是:“帮我查一下今天发生了什么。”


而是:


“持续关注这个领域,真正重要的变化出现时告诉我。”


不是:“整理今天的邮件。”


而是:


“管理我的收件箱,只把我必须亲自处理的事交给我。”


这三者的差异,不只是任务长度。


过去正在发生更远的未来
MessageTaskResponsibility
SessionProjectRelationship
操作委托长期授权
AppCapabilityAgent-managed world


Task会结束。


Responsibility不会。


Task的状态是Done。


Responsibility的状态更接近:


Active、Suspended、Escalated、Revoked。启用、暂停、升级、撤销。


这也是常驻Agent最重要的变化。


它开始拥有长期目标、工作历史、权限边界、事件订阅、世界状态和待履行的职责。


于是,真正重要的问题变成:


  • 它现在负责什么?


  • 它承诺了什么?


  • 它在等待什么事件?


  • 它拥有什么权限?


  • 它做了哪些动作?


  • 它在什么情况下必须回来找我?


  • 我怎样暂停它、收回它的权限,或者把它交给另一个人管理?


这已经不像在使用一个软件功能。


更像是在管理一个被长期委托的数字角色。


三、执行权正在离开界面


传统GUI的伟大之处,在于它把机器的复杂功能,变成了人可以逐步操作的对象。


窗口、菜单、文件夹、按钮、鼠标指针,本质上都在回答一个问题:


我怎样让计算机完成这件事?


路径通常是这样的:


打开App→找到功能→点击按钮→填写参数→确认执行→看结果


这套路径的前提是:人负责导航、选择、执行和确认。


但Agent正在把其中越来越多的环节接过去。


未来的路径会逐渐变成:


表达结果→系统理解意图→Agent选择工具与路径→机器行动→人只在关键处介入


微软Project Solara对这轮变化的表达很激进:从“打开的软件”走向“被调用的智能”,从按钮和图形界面走向意图表达,设备则成为进入长期运行智能的窗口。它提出的“just-in-time UI”,本质上是在设想:同一个Agent可以根据设备、上下文和交互方式,临时生成适合此刻的界面。


这意味着,最先消失的可能不是屏幕,而是mode selection模式选择。


今天的用户还常常需要判断:


  • 我现在应该搜索,还是问Chat?


  • 应该开Deep Research,还是开浏览器?


  • 应该调用Agent,还是自己操作网页?


  • 应该进入哪一个App?


  • 应该选择哪一种工作流?


未来这些选择会越来越多地变成系统内部的问题。


人表达Outcome结果,机器决定Execution执行。


与此同时,App不会真正消失。


它会从过去的“人类导航单位”,逐渐降级成未来的“机器能力容器”。


过去是:人知道功能藏在哪个App。


未来是:Agent知道哪个App、工具、网站、协议、模型或服务可以完成这件事。


这不是App消失。


而是App从前台入口,退到后台能力层。


四、人类没有失去控制权,只是控制权换了位置


当机器开始接管执行,最自然的担忧是:


AI越强,人是不是越失去控制权?


这其实把“操作权”和“行动权”混在了一起。


传统GUI给人很强的过程控制。


点哪个菜单、打开哪个文件、选哪条路径、填写什么参数、执行哪个动作,都是人决定。


Agent拿走这些过程操作后,表面看,人类似乎失去了一部分控制。


但更准确的描述是:


人类的控制权,正在从“如何做”迁移到“要做什么、做到哪里、什么情况下必须停下来”。


过去,人控制:


  • 每一步操作;


  • 每一个菜单;


  • 每一次输入;


  • 每一个执行动作。


未来,人更可能控制:


  • 最终目标;


  • 可接受的代价;


  • 优先级;


  • 时间边界;


  • 金额边界;


  • 数据边界;


  • 对外沟通边界;


  • 例外处理规则;


  • 是否接受结果;


  • 是否继续授权。


以商务出差为例。


传统UI下,你需要:


打开订票App→搜索城市→选择日期→对比航班→看价格→填个人信息→确认支付。


Agent-native的表达可能是:


“按我过往的商务出差偏好处理。超过3000元、涉及改签风险、红眼航班或签证问题时再问我。”


前者是Control every step。


后者是Control policy and boundary。


人不再是亲自移动鼠标的人。


人开始变成Principal:定义目标、授予有限权力、处理价值冲突、接受最终结果的人。


这也是未来界面最深的一层变化:


Human agency不等于human operation。


人不必亲手操作每一步,仍然可以拥有结果、边界和责任。


五、反直觉:AI越强,界面未必越少


一种流行想象是:


AI越可靠


→人越不需要操作


→UI越少


→最终只剩语音,或一个聊天框。


这只说对了一半,人确实会越来越少参与连续执行。


但这不等于人应该什么都看不见。


因为如果Agent一天完成几千次动作,让人逐条看几千条日志,没有任何意义。


人不需要知道:


它点了哪个按钮。


它打开了哪个网页。


它复制了哪一段文字。


它调用了第几个工具。


人真正需要知道的是:


  • 它为什么相信这个结果;


  • 哪个假设发生了变化;


  • 哪个动作不可逆;


  • 哪个结果无法验证;


  • 它动用了什么权限;


  • 它为什么认为自己有资格这样做;


  • 它在哪里触及了默认规则的边界。


因此,未来UI既不会简单走向“更多透明”,也不会走向“完全黑箱”。


它会走向:


Just enough transparency恰到好处地透明


低风险、可逆、确定、短任务,UI可以越来越隐形。


高风险、不可逆、不确定、涉及真实价值取舍的任务,UI不但不能消失,反而会变得比今天更重要。


可以把未来交互写成一个简单函数:


Interface=f(Risk,Reversibility,Uncertainty,Duration)


它大致会导向几种不同制度:


  • 低风险、可逆、确定、短任务:Invisible Automation;


  • 风险略高:Act→Inform;


  • 涉及付款、对外沟通、重要修改:Prepare→Approve;


  • 高不确定性、创造性任务:Shared Workspace;


  • 长期、多Agent、高责任任务:Role/Policy/Exception UI。


所以,未来UI会从continuous interaction持续互动,变成selective intervention选择性干预。


平常,机器自动流过。


到了真正需要人类判断的地方,机器停下来。



六、未来界面真正要管理的,不是页面,而是行动权


如果一个Agent要替人行动,人和机器之间究竟需要被明确管理什么?


答案是一套新的关系对象。


1.Goal:人想让世界变成什么样


Goal不是一句Prompt。


Prompt是表达方式。


Goal才应该是持续存在的系统对象。


比如:


“完成一本关于AI时代技术品味的书。”


这个Goal下面,未来可能天然挂着:


  • Context;


  • 相关文件;


  • Research;


  • Deadline;


  • Budget;


  • Success criteria;


  • 当前状态;


  • Agents;


  • Decisions;


  • History;


  • Constraints。


它可能持续几个月,甚至几年。


你离开电脑之后,它依然存在。


所以,Goal很可能成为File、Folder、Project之上的新抽象。


因为文件终于开始被放进一个更接近人类意图的结构里。


2.Responsibility:谁长期负责这件事


Task是:


“查一下今天发生了什么。”


Responsibility是:


“持续关注这个领域,出现真正重要的变化时告诉我。”


Task是工作的分解单位。


Responsibility才是长期委托的单位。


这也是为什么“AI员工”这个词虽然粗糙,却抓到了一点什么:未来的关键不只是某个Agent能否做完任务,而是它是否拥有明确、持续、有限的职责域。


但“数字员工”仍然不够准确。


Agent不应该被赋予无限责任。


它应当是一个受限角色。


它有职责,也有权限边界;能主动行动,也必须接受暂停、撤权和接管。


3.State:我们共同面对的现实是什么


未来复杂协作的中心,是双方共同面对的State状态。


它可能是:


  • 代码库;


  • 文档;


  • 表格;


  • 设计稿;


  • 客户状态;


  • 供应链数据;


  • 订单;


  • 日程;


  • 数据集;


  • 研究资料;


  • 一个正在变化的世界模型。


所以未来复杂知识工作最稳定的形态,很可能不是Shared conversation。


而是:


Shared state共享状态


人和Agent围绕同一个Artifact工作。


聊天退到边缘,负责澄清、协商、批评、重定向。


真正的“共同事实”,存在于Artifact和State里,而不是聊天记录里。


AG-UI这类新协议之所以值得注意,因为它开始把Agent状态、UI intent、工具调用和用户交互视为同一条实时交互边界上的对象。


4.Trigger:机器什么时候可以主动行动


传统GUI的核心时间结构是:


now。


点击以后,现在执行。


常驻Agent的时间结构则是:


if/when/until。


  • 如果价格低于某个阈值;


  • 收到某个人的邮件时;


  • 如果项目三天没有进展;


  • 一旦竞品发布新产品;


  • 如果一个研究结论被新证据推翻;


  • 每周五生成一次简报;


  • 当客户流失风险达到某个等级时。


Trigger触发器不是高级版日程。


它是:


机器何时获得Initiative的条件。


没有Trigger,所谓“全天候Agent”大概率仍然只是一个后台Chatbot。


5.Authority:机器能做到哪里


传统软件权限问的是:


App能不能访问相机?


Agent世界的问题是:


这个Agent在什么条件下,可以代表我做什么?


这完全不是一个层级。


未来的授权会越来越像:


  • 可以读邮件,但不能发送;


  • 可以草拟合同,但不能签署;


  • 100美元以下的采购可以自行处理;


  • 公开发布必须人工确认;


  • 可以与供应商协商,但不能承诺价格;


  • 晚上十点以后,只有P0风险可以打扰;


  • 可以访问项目资料,但不能把数据带出组织边界。


过去软件有Settings。


Agent时代,越来越重要的对象会是:


Policy规则


Settings管理软件如何运行。


Policy管理机器可以代表谁行动、行动到什么程度。


Workday已经把Agent Interaction Policy作为独立安全对象,用来定义哪些用户可以调用哪些Agent技能。


这只是很早期的形态,但方向已经出现了。


6.Exception:机器在哪里必须把权力交还给人


Notification说的是:


Something happened。


Exception说的是:


Machine agency stops here.Human agency required.


这是完全不同的东西。


未来的Exception可能包括:


  • 两个方案都可行,但成本和时间存在不可自动化的取舍;


  • 付款超过预算;


  • 某个高风险动作需要扩大权限;


  • 先前成立的假设被新数据推翻;


  • 结果看似完成,但无法验证;


  • Agent遇到与既定目标冲突的新情况;


  • Agent无法继续推进,需要重新定义目标。


Exception是权力交接点。


也是未来Agent Inbox最值得关注的地方。


过去的Inbox是:别人希望我做什么。


未来的Inbox更可能是:


机器在哪些地方不能替我做决定。


7.Verification:我怎么知道它真的做对了


AI越强,人越不应该逐步盯着它做事。


人应该看证据。


未来最重要的迁移,可能是:


Reasoning visibility→Evidence visibility。


我们今天经常观看:Agent做了什么。


未来更重要的会是:有什么证据证明它做对了?


这会带来一批新对象:


  • Receipt;


  • Evidence;


  • Source;


  • Test;


  • Provenance;


  • Diff;


  • Outcome verification。


人不需要重读整个系统。


人需要知道:


它改了什么。


为什么改。


哪些地方仍然不确定。


什么证据支持它说“完成了”。


W3C最新的《Web User Agents》草案也已经把软件“代表用户行动”放到更严肃的位置:它把保护、诚实和忠诚视为user agent对用户的基本职责。这个草案,说明浏览器、助手和Agent正开始共享一种更本质的定义:它们不是单纯呈现信息的工具,而是代表用户与外部世界交涉的软件。


8.Recovery:如果不对,我怎样把权力拿回来


传统Ctrl+Z撤销的是:一次编辑。


Agent世界需要撤销的是:一条自主行动轨迹。


这可能意味着:


  • Pause;


  • Cancel;


  • Rollback;


  • Revoke;


  • Restore;


  • Fork;


  • Compensate。


你不只是撤销一封邮件,可能需要暂停整个持续责任,收回权限,恢复到某个检查点,取消后续计划,甚至要求系统对已经发生的动作做补偿。


所以Recovery恢复比Undo撤销更像Agent时代的基础能力。


行动能力越大,可恢复性越重要。


这不是因为模型不够聪明。


而是因为“替人行动”这件事本身,就要求人始终保有收回行动权的能力。


七、GUI之后,是一门新的交互语法


GUI时代,Window、Icon、Menu、Pointer的意义,在于它们把复杂计算函数,变成了用户可以理解和操作的对象。


Agent时代真正对应的,不太可能是一组新的视觉控件。


它更像一组新的关系原语:


Goal


Responsibility


State


Authority


Trigger


Exception


Verification


Recovery


以及一组新的动词:


Define


Delegate


Grant


Observe


Act


Escalate


Verify


Override


Revoke


Accept


把它们连起来,就得到一条新的交互语法:


人定义Goal。


人委托Responsibility。


人授予有限Authority。


Agent观察State。


Trigger激活行动。


Agent在边界内执行。


出现Exception时升级给人。


人做价值判断或重新定向。


Agent提供Verification。


人接受结果,或暂停、撤权、恢复。


注意,这里已经很少出现传统GUI的核心动词:


Click、Open、Scroll、Navigate、Launch app。


它们没有完全消失,但正在退到更底层。


GUI把机器的功能变成可操作对象;


Agent Interface要把机器的行动权变成可操作对象。


八、Chat、生成式UI、共享工作区和眼镜,不是在争同一个终局


今天关于未来界面的讨论,常常把很多不同层的东西混在一起。


Chat、Canvas、Generative UI、语音、眼镜、Agent OS、Shared Workspace,看上去都在竞争“下一代界面”。


其实它们解决的不是同一个问题。


1、Chat:未来的语言化控制通道


Chat不会消失。


它仍然是人表达模糊意图最自然的入口。


但它不太适合承载一切。


Chat更适合:


  • 发起委托;


  • 澄清目标;


  • 协商取舍;


  • 质疑结果;


  • 中断任务;


  • 重新定向;


  • 追问“为什么”;


  • Debug Agent的判断。


它更像:


语言化的Command Line+Negotiation Channel。


重要,但不等于整个操作系统。


2、Shared Workspace:复杂创造的真正中心


当人和Agent真正一起写代码、做研究、改文档、设计产品、分析数据时,最重要的并不是聊天记录。


而是共同操作的对象。


Conversation at the edge,Artifact at the center。


聊天负责协商。


Artifact承担共同事实。


这也是为什么未来所有界面不会都缩成一个输入框。


复杂工作必须有共同状态、结构化对象、差异视图、验证机制和可恢复历史。


3、Generative UI:把语义临时编译成最适合当前任务的界面


Generative UI很重要,但它解决的是:


这一刻,机器应该给人呈现什么操作表面?


同一个Exception,有时适合两个按钮。


有时适合一张比较表。


有时适合地图。


有时适合一段Diff。


有时适合一个模拟器。


Google A2UI的思路很有代表性:Agent不直接交付一张任意生成的网页,而是用结构化数据表达“应该渲染什么”,再由宿主应用用自己的组件系统生成界面。


这意味着:


UI开始从application property,变成runtime output。


但Generative UI不是终局。


它只是Presentation Layer的突破。


真正决定一张临时界面该长什么样的,是更底层的语义对象:这是授权、异常、验证、恢复,还是目标取舍。


所以:


Generative UI的终局不是没有原语的UI。


恰恰相反,它需要更稳定的语义原语,才能每次生成不同但正确的界面。


4、Ambient Interface:屏幕不会消失,它会变成信心表面


眼镜、耳机、戒指、手机、桌面设备,都可能成为Agent出现的入口。


低风险任务当然会越来越无界面化。


提醒、记录、导航、整理、环境感知,很多动作会在你没有主动打开软件时发生。


但这不意味着屏幕消失,更准确的描述是:


Screen将从execution surface,变成confidence surface。


平时,它不必出现。


当你需要比较、验证、授权、复盘、撤回或处理风险时,它出现。


不是为了让你操作机器。


而是为了让你确认自己仍掌握局面。


九、未来的桌面,不是App首页,而是注意力路由器


回到开头的三块未来首页。


经过前面的拆解,它们不再只是一个漂亮猜想。


它们是Agent-native计算最自然的结果。


1、What I care about


Goal/Responsibility目标/责任


什么在被持续推进。


什么被暂停。


什么需要重设边界。


什么长期由谁负责。


2、What has changed


State/Results/Verification状态/结果/验证


世界发生了什么变化。


Agent做了什么。


它留下了什么证据。


哪些结果已经验证,哪些仍然不确定。


3、What needs me


Exception/Decision/Authority request例外/决定/权限请求


哪些地方到了机器行动的边界。


哪些地方必须由人做价值判断。


哪些地方需要扩大、收回或修改授权。


这其实就是未来的Agent Inbox。


它不再是Email Inbox,是:


Human Attention Router人类注意力路由器。


当Agent足够多以后,人类最稀缺的资源不再是输入命令的能力。


而是注意力。


不是“怎样让机器开始做事”。


而是“在什么时刻,什么事情值得我亲自出现”。


十、多Agent时代,界面最终会像组织结构


如果未来一个人不再只拥有一个AI,而是拥有:


  • 研究Agent;


  • 编码Agent;


  • 日程Agent;


  • 财务Agent;


  • 招聘Agent;


  • 个人Agent;


  • 公司Agent;


  • 以及一群临时Subagents;


那么“和二十个Agent逐一聊天”,不可能成为稳定界面。


人也不会愿意观看二十个Agent的完整内部协作过程。


未来人真正需要管理的是:


  • Role;


  • Responsibility;


  • Authority;


  • Budget;


  • Policy;


  • Escalation;


  • Evidence;


  • Ownership。


这也是为什么Agent UI最后会越来越像Organization UI。


Salesforce已经在产品层面呈现了很早期的形态:一个任务可以同时分配给AI Agent与人类审核者,Agent先填充内容,再停下来等待人类审阅;无法完成时,也可以转交给预设的fallback assignee。


它说明,软件开始第一次以一种可委托、可约束、可追责的角色,进入组织结构。


过去的组织图只安排人和部门。


未来的组织图会开始安排:


  • 人;


  • Agent;


  • 工作流;


  • 权限;


  • 预算;


  • 审批;


  • 责任边界;


  • 例外升级路径。


十一、界面将成为人类意图、机器行动权与责任交接发生的地方


未来不会只有一种“AGI的iPhone界面”。


不会所有事情都变成Chat,不会所有屏幕都消失,不会所有任务都交给AI。


真正稳定下来的,是不同风险、不同责任、不同不确定性之下的几套交互制度。


低风险任务,自动化会隐形。


复杂创造,人和AI会共同编辑同一个世界状态。


高风险行动,会需要结构化授权、证据、验证和确认。


长期多Agent系统,会要求我们管理角色、责任、预算与升级路径。


所以,未来UI的问题不再是:“我怎样让机器做这件事?”


而是:


“我想让世界变成什么样?”


“谁来持续负责?”


“它可以做到哪里?”


“它什么时候可以自己行动?”


“什么情况下必须回来找我?”


“我怎样知道它做对了?”


“做错以后,我怎样把行动权拿回来?”


过去,界面让人学会操作机器。


接下来,界面要让人学会把机器的行动权交出去,又在必要时拿回来。

AI行业信号频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP