AI终将摆脱屏幕进入日常生活,本文分析了当下AI语音交互的主流硬件入口与现存挑战,探讨AI自然交互的发展方向。 ## 1. 语音成为AI时代更适配的自然交互方式 相比PC时代的手动打字输入需要预先组织逻辑,语音输入允许边输出边思考修正,无需稳定桌面环境与专业文字能力,更接近人类思维的原生模式,催生了一批围绕语音入口的AI产品。 ## 2. 当前主流AI语音入口的三类方案与各自痛点 - **TWS耳机组合方案:评价标准转向人声分离能力** 一副成熟TWS耳机搭配手机AI就能组成低成本24小时AI副手,性能优于多数专用AI硬件,但核心瓶颈是麦克风的环境人声处理。过去耳机比拼音质、延迟、降噪,未来需额外比拼人声降噪的强度与准确率,耳机麦克风已从通话配件升级为前端AI控制器。 - **智能眼镜方案:受隐私与绑定限制难成主流** 智能眼镜主打“所见即所问”的AI交互,但带拍摄收音功能的产品会带来社交压力,硬件性能不如成熟TWS,且多深度绑定品牌端AI,限制了用户对模型的选择权,难以成为主流。 - **独立语音硬件:语音输入获得稳定物理入口** 2026年兴起独立AI语音入口方案,OpenAI的Codex Micro专门设置了PTT按键,象征语音输入已成为高频交互方式,更有无屏便携语音设备的规划方向。此外学界已有无声语音交互的探索,通过识别舌部运动、面部肌肉活动解码指令,距离消费级应用仍有距离。 ## 3. AI语音交互的核心待解难题:平衡成本与体验 语音交互更符合人类沟通习惯,但token消耗远高于纯文本输入:原生多模态语音处理的token消耗量通常是纯文本的10倍以上,自然度越高计算越复杂,用户消费成本也越高。未来AI厂商的核心竞争点,是以更低延迟、更少冗算、更透明计费,调和不同模态的成本差异,让用户愿意持续使用语音交互。
全世界都在讲AI 话
2026-07-21 12:10

全世界都在讲AI 话

本文来自微信公众号: 爱范儿 ,作者:发现明日产品的,编辑:肖钦鹏,原文标题:《全世界都在讲 AI 话|AI 器物志》


智能手机统治了过去十几年的数字生态,它是注意力的黑洞,是我们最私密的随身之物。但手机从设计之初就是为「人盯着它」而生的——它的全部逻辑,都止于屏幕。


AI的需求却恰恰相反:它需要持续感知物理世界——见你所见,听你所闻,随时在场,而非等你解锁屏幕才醒来。


当AI真正成为一种基础能力,它迟早要从屏幕里破壳而出,寻找属于它自己的形状。这将是一个漫长的探索和演化过程。


「AI器物志」栏目由此而来,爱范儿想和你一起持续观察:AI如何改变硬件设计,如何重塑人机交互,以及更重要的——AI将以怎样的形态进入我们的日常生活?


这是「AI器物志」的第19篇文章。


过去两年里,AI最明显的变化不只是模型变聪明,而是它的定位从少数人的专业工具,转变成了日常生活的基础能力。


如今,我们更是习惯了在走路、开车、做饭甚至摸鱼期间,随时随地向AI发出指令。


图|Google


只不过随着频率提高,以PC时代键鼠交互为主的人机交互方式正在逐渐暴露出短板——


「手动打字」需要用户先有一个想法,再将散乱的思绪组织成连贯语言,还要在叙述中保持一定的逻辑关系,才能将脑袋里想的变成AI能够理解的提示。


而在键盘的另一边,手机时代所主导的「语音输入」就几乎没有这样的桎梏。


毕竟讲话和打字最大的区别,就是语音允许人们一边输出,一边思考、补充和修正,相比键盘输入更接近思维原本发生的方式。


此外,语音输入不需要稳定的桌面环境,也不要求用户持续低头,更不用优秀的文字表达能力——


对于绝大多数没有受过系统写作训练的普通人来说,语音远比文字输入更接近「真正的自然交互」。


这种广泛的需求之下,自然也催生出了一批围绕语音入口展开的产品。


比如势头正盛的Plaud,主打的就是将录音、转写和总结包装成完整工作流;


成为样板产品的Typeless则负责删除语气词、进行格式清洗后「帮你成文」。


诸如光帆Lightwear之类的可穿戴设备则更进一步,试图整合出一条传统智能手机之外,全场景的完整AI使用流。


图|光帆科技


这些产品的形态各不相同,押注的却是同一件事:


下一代AI入口,未必要求用户坐下来、打开应用并认真打字。


嘿,AI


「自然语言交互」听上去非常先进,但它先进的地方其实是沟通效率,技术原理上并没有什么惊天地泣鬼神的地方。


门槛最低的方案,就是一副TWS耳机加手机上的AI,就能组成一个24小时在线的虚拟副手。


初代AirPods广告《Bounce》|Apple


毕竟耳机本来就在耳朵里,手机系统与第三方app也有现成的语音转写、快捷指令和跨应用输入。


不需要任何专用硬件,就可以把你散碎的命令传达给任何一个AI模型。


更残酷的是,它的速度、兼容性和跨设备能力,仍然优于市面上大多数号称「开创先河」的专用AI硬件——


图|Mashable


然而现实情况是,这套近乎无门槛的组合,真正的瓶颈不在手机、而在麦克风对环境人声的处理。


就拿AirPods为例,由于AirPods的麦克风策略强调声音自然度、不愿意给人声降噪,在多人环境里经常会出现将周围说话的声音一并采集到转成文字的问题。


这对于打电话或者发语音没什么,但对于AI输入,一旦提示词「夹生」,就很容易得到完全不相关的回答:



相比之下,国产品牌的TWS耳机普遍采用了更激进的人声隔离策略,牺牲了一些通透模式自然度,换来了电话和AI语音期间更好的准确率。


如果往更深层看,这意味着在AI成为「主流使用场景」的当下,耳机好坏的评价标准正在改变——


过去耳机比的是音质、延迟和降噪,未来除了前面这些,更要比较人声降噪的强度、准确性和分离能力。


甚至我们可以说,耳机麦克风正在从逐渐被人遗忘的通话配件,一举变成了最前端的AI控制器。


语音指挥的第二条路线,则是智能眼镜。


尽管智能眼镜总是强调「给人生加上一块HUD」,但从商品化结果来看,唯一成功的智能眼镜仍是以语音、拍照和开放式音频为核心的基础款。


图|Laptop Mag


这背后的原因倒不复杂:眼镜显示系统会牺牲重量、续航和成本,更需要从0培养一套全新的用户使用习惯。


而「看见什么问什么,AI讲给你听」,本身就足够构成一个相对清晰的AI卖点了。


图|Meta


但智能眼镜的问题在于,它的「无感」更多存在于宣传片里。


毕竟当一副带摄像头的眼镜持续朝向别人时,对方很难判断设备是否正在拍摄或者收音,这种不确定性本身就会制造社交压力。


再加上受限于体积和续航,智能眼镜的麦克风阵列、通话降噪和扬声器效果,不一定比成熟的TWS耳机更好。


更重要的是,在目前智能眼镜的销售模式中,这类产品往往与品牌客户端和云端模型深度绑定,用户在模型选择、数据迁移和跨设备切换方面缺乏自由度。


最简单的例子就是Meta。


Meta Ray-Ban智能眼镜在各个方面都比较平衡,却强制用户连接Meta AI,不能作为蓝牙音频设备直接唤醒Siri或者其他智能助手。


图|Engadget


这种程度的绑定让智能眼镜虽然成为了「语音AI交互」的代表性产品,却很难成为那个主流产品。


第三条路线,则是2026年以来逐渐兴起的道路——为语音输入AI制造独立硬件入口。


比如刚刚OpenAI与Work Louder联名的的Codex Micro,就是一块面向AI智能体的外置控制台。


并且上面专门设置了一个用于语音输入的push-to-talk(PTT)按键:


图|OpenAI


尽管Codex Micro本身没有麦克风,PTT需要调用电脑连接的其他收音设备,但这种设计依然具有象征意义:


语音输入已经不再只是UI中的一个小图标,而开始逐渐获得类似鼠标右键、手机拍照键或者键盘指纹一样的稳定的物理位置。


将语音输入单独作为一个按键设置,基本上承认了这种AI交互方式的高频属性——甚至对某些用户可能比26个字母键都要更高频。


而PTT/TNT更进一步的设想,就是彻底摆脱屏幕。


爱范儿之前爆料过,OpenAI正在规划的若干硬件产品中,就包括一个无屏的便携设备,通过语音、摄像头和环境传感器理解用户所处的情境。


如果OpenAI真的这样设计,无异于承认了曾经Humane AI Pin的道路。


当然,背后有ChatGPT和Codex做背书,OpenAI的徽章肯定会比Humane的更实用。


与此同时,面对AI语音交互最难绕开的两个问题:公共场合说出个人安排的尴尬,以及嘈杂环境中的识别失真,研究者们也有了一些奇思妙想。


比如近期出现的一些「超声波舌部动作识别」设备,通过抵在下颌的超声波探头读取舌头运动,再用机器学习将其解码为语言:


图|Hackaday


另一些研究则尝试把传感器装进眼镜或头显,通过面颊、颧骨和口部的细微运动识别无声指令——之前被苹果悄悄收购的Q.ai就是研究这个方向的。


关联阅读:苹果史上第二大收购案,目标却不是手机|硬哲学


这些装置距离消费级产品仍然很远,识别范围、准确率和佩戴体验也存在明显限制,但方向已经足够清晰。


未来的「语音输入」未必真的需要发出声音——所谓语音交互,最终可能演化为对人类发声动作、口型乃至面部肌肉活动的直接识别。


帮我算算token用量


归根结底,为什么语音输入能够在AI时代获得超越键盘的声望,还是因为人类不是纯粹的「视觉动物」。


换言之,人们虽然习惯于用眼睛接收信息,但并不擅长用视觉信号发送信息。


在传递信息这件事上,我们仍然遵循着30万年前的习惯:发出「咕咕嘎嘎」的声音就是要比打手势效率高。


用语音指挥AI,看似是一种相对低效的使用方式——人在讲话时经常重复、跑题,表达也很难称得上精炼。


但它最大的特点,就是消弭了AI的工具感。


无论用户潜意识里把AI当作下属、秘书还是同伴,以对话作为交流媒介,始终比填写命令框更接近人类本源的协作方式:


然而「语音交互」虽然便利,这种便利的隐性成本也在上升。


传统STT工具只负责把声音转换成文字,最终模型用来计费的只有转换后的文本输入与输出token;


而Typeless之类的「文本清洗」工具还要额外调用模型,对口语进行整理和改写,再把整理后的内容发送给另一个AI,中间又叠加了一层token消耗。


图|MakeUseOf


而当各家的多模态模型进入「原生音频」的阶段之后,由于需要持续处理声音、上下文、语气、打断和输出,一个工作阶段内的token消耗量往往是纯文本的10倍或更高。


虽然与高清图片和视频处理相比,语音处理的总token成本依然不算离谱,但它已经不再是一个可以忽略的附属功能。


尤其在长时间实时对话中,用户很难像输入文字那样主动控制信息长度,模型却必须持续维持连接、理解上下文并生成反馈。


图|Mashable


这就导致AI语音交互越自然,背后的计算过程反而越复杂,用户最终的消费成本也就更高。


这一点几乎成为了最近AI厂商们的一种「阳谋」——


毕竟鼓励语音交互一方面好处多多,另一方面更是将token消耗量推上一个新台阶,没有厂商会和收费过不去。


因此,对于模型厂商以及配件品牌来说,未来AI业务的竞争不只是能不能听懂人话。


更关键的是,谁能以更低延迟、更少冗算和更透明的计费,调和好不同模态业务之间巨大的成本差异。


毕竟让人们开口对AI讲话并不难,真正难的是让人们想要一直说下去。

AI原生产品日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP