**OpenAI 以超3亿美元收购相机技术公司Glass Imaging,旨在为AI硬件提供真实而非“猜”出来的图像输入,让机器能准确感知现实世界以驱动智能体行动。** **要点** **1. 收购核心:用神经网络替代传统ISP** Glass Imaging开发Neural ISP技术,用联合训练的神经网络同时完成去马赛克、降噪、镜头像差校正等环节,直接从RAW数据输出RGB图像,恢复传感器实际捕捉信息,而非像生成式AI那样“凭空补全”。 **2. 真实优先:服务于Agent而非修图** 与AI修图追求“好看”不同,Glass Imaging的技术目标是还原真实纹理、文字和空间关系。当图像要交给AI Agent判断并行动时,虚假信息会导致错误操作,这是OpenAI收购的关键动因。 **3. 重塑硬件设计逻辑:允许光学缺陷存在** 该技术允许镜头保留可被计算逆转的缺陷,只要传感器捕捉到足够信息即可。未来AI设备的镜头、传感器、NPU与模型将共同设计,硬件可更小更薄,部分光学问题转移给神经网络解决。
OpenAI 买下iPhone 人像模式幕后功臣,要给AI 装上一双新眼睛
2026-09-19 11:08

OpenAI 买下iPhone 人像模式幕后功臣,要给AI 装上一双新眼睛

本文来自微信公众号: APPSO ,作者:发现明日产品的,原文标题:《OpenAI 买下 iPhone 人像模式幕后功臣,要给 AI 装上一双新眼睛》


过去一周之内,连着两台新手机产品刷屏,一台是Apple新出的iPhone 18,一台则是豆包手机助手消费者版发布——首款搭载机型努比亚NaviX Ultra在今日开售,AI将进入手机系统,我们也做过详细测评。



AI开始看见屏幕,也开始伸手触碰屏幕。与此同时,《华尔街日报》透露,OpenAI已经以超过3亿美元收购相机技术公司Glass Imaging。



交易尚未得到OpenAI公开确认,但这块新拼图出现的位置十分微妙:去年,OpenAI花65亿美元收购了Jony Ive创办的硬件公司io后,还没有做出大名堂,工业设计师和相机工程师就已经先后到位。


是AI,但不是修图AI


Glass Imaging由Ziv Attar和Tom Bishop创办,两人此前都曾在苹果从事计算摄影工作,并参与过iPhone人像模式的开发。


不过,Glass Imaging研究的不是今天最常见的AI修图,是用AI反过来影响相机硬件的设计逻辑。


手机按下快门后,传感器最先得到的并不是一张可以直接观看的照片,而是一堆原始光信号。传统的图像信号处理器需要完成降噪、校色、锐化等工序,才会在屏幕上生成最终图像。


Glass Imaging试图用一套针对具体镜头和传感器训练的神经网络接管这条流水线。它的技术底层还是Neural ISP,传统ISP会把RAW数据依次交给去马赛克、降噪、多帧融合、锐化等模块,每一步由独立算法处理,也会在过程中丢掉一部分信息。


GlassAI则从传感器的RAW连拍数据出发,把去马赛克、降噪、去模糊、多帧融合放进同一个联合训练的网络,同时加入传统ISP不擅长的镜头像差反卷积和传感器串扰校正,最后直接输出成品RGB图像。



以Neural ISP为基础,Glass Imaging吸收并重写了传统ISP的大量核心环节。它需要学的是,一台相机如何产生误差,再在图像形成时把误差倒推回去。Glass Imaging的思路是,镜头只要把足够的信息送到传感器,剩余的模糊、色差和畸变可以交给专门训练的网络修复。



但这里所谓的「修复」并不是指AI修图那种意义上的「修」,生成式修图,的确可以把远处模糊的文字、月亮和人脸「猜」得更加清晰,但清晰不等于真实。Glass Imaging的资料称,其网络针对具体光学系统和RAW数据训练,目标是恢复传感器实际捕捉到的信息,而不是凭常识和推论生成新的纹理。


相比于AI目前在图像处理中的主要作用,这很不一样,原因在于:如果摄像头只是为了拍朋友圈,照片好看即可;可如果图像要交给Agent判断现实并采取行动,那么凭空补出来的物体和文字就可能导致错误操作——这才能理解OpenAI为何会对它感兴趣。


AI设备的两种「观看权」


对手机厂商来说,Neural ISP技术可以让更小的镜头拍出更清晰的照片;但对一家正在制造AI硬件的公司来说,它还有另一层意义:模型看到的世界,首先取决于摄像头交给它什么。


AI设备需要两种「观看」能力。第一种发生在屏幕以内,AI要看懂用户正在浏览什么,读取哪些本地信息,还要获得调用不同App的权限。在这个基础之上,理解整个操作系统里的上下文。



第二种发生在屏幕以外:菜单上的文字、桌上的物品、眼前的道路和房间里的设备,无法只靠聊天记录就让AI「知道」,需要先拍下一张照片,再把照片交给AI。


照片是人观看的终点,却可能只是Agent工作的起点。未来的AI设备若要及时行动,就必须缩短「人看见、拍摄、上传、询问」这一整条链路。


摄像头的身份也因此发生了变化,过去它替人保存值得回看的画面,在未来,将变为向机器提供判断下一步行动的依据。


GlassAI的变焦技术已经进入荣耀600系列,说明它至少完成了从模型、手机芯片到量产设备的适配;公司还曾在骁龙8 Elite Gen 5参考设备上展示实时4K视频处理和20倍以上变焦增强。


这些能力目前是被用来让人把远处拍得更清楚,在未来,当摄像头连接的不是相册,而是一个准备采取行动的Agent,成像的评价标准就会发生变化。


照片不只要看起来漂亮,还要尽可能真实、稳定、及时地呈现文字、物体和空间关系,因为模型接下来可能据此识别商品、操作设备,甚至规划行动。


倒不是说,GlassAI会让相机自动变成智能体,却补上了智能体进入现实之前最底层的一环:尽量把传感器实际看到的信息,准确地交给模型。


Glass Imaging揭示的第一种变化,是硬件与软件之间的分工被重新划定。过去,相机厂商先尽量用镜头和传感器解决像差、模糊与噪声,再让ISP修饰最终图像;GlassAI则允许硬件保留一些能够被计算逆转的缺陷,只要传感器还捕捉到了足够的信息,专门训练的网络便可以在成像过程中将其恢复。镜头因此可以更小,像素可以继续缩小,一部分原本需要增加镜片、厚度和成本才能解决的问题,被转移给了神经网络。



那么就有可能,未来AI设备的硬件,不必得被完整设计出来之后,再往里面「塞一个模型」。镜头、传感器、NPU、内存和模型会从一开始共同设计,传感器负责保留哪些原始信号、神经网络能够修复哪些误差、设备需要多大的本地算力、能否在低功耗状态下持续理解环境……这些问题都将反过来影响硬件的形状。


比如说,假设工程师提前知道,某些光学缺陷能够被神经网络稳定修复,下一代相机在选择镜头数量、像素尺寸、传感器和机身厚度时,就可以包容过去无法接受的缺陷。可能是不再通过堆叠更多镜片彻底消除像差,也可能是确保传感器仍然保留足够的原始信息,再交给AI恢复。



同样的逻辑也可能延伸到麦克风、空间传感器和其他感知部件。过去,硬件负责把世界尽量完整地记录下来,软件只在事后处理;未来,硬件只需要捕捉模型能够理解和还原的信息,模型则从一开始参与影响硬件应该怎样观看世界。


模型不负责决定摄像头看什么,却会改变相机必须用多少硬件,才能得到一幅足以被还原和理解的图像。

AI行业信号频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP