本文来自微信公众号:浮之静,作者:lencx,头图来自:AI生成
最近大家应该都被各种 Astra 案例刷屏了:从 Blender、Photoshop、Unity 到机器人控制,那些原本需要专门学习的软件,似乎一下子变成了只要说句话就能操作的玩具。

一、实测 Astra
我这两天也浅浅体验了下 Astra 对专业工具的操控。它确实很强,但给我最大的感受:AI 是放大器,不是许愿池。模型可以帮你跨过操作门槛,却不能凭空补上领域知识,也不会自动把模糊的审美变成清晰的标准。
这次体验里还有两件事让我印象深刻。一是 AI 操作工具时会留下大量脚本、日志和中间文件,它们未来或许会成为比最终成品更可靠的原创证明。二是我发现,面对 AI 产物,我很容易说出“这里不够好”,却很难继续解释“怎样才算好”。
梦回编程之初
互联网都是骗人的,到处是坑,原样照搬根本跑不起来...
我之前已经在大量使用 Codex Computer Use 操纵各种工具来辅助编程,也不止一次夸它是解决复杂任务、Debug 长链路问题的神器。Astra 则在此基础上,进一步加强了对专业软件的操控力,让我忍不住想试试手。
这个过程让我梦回编程之初。那时候跟着网上的教程手敲代码,简单任务很容易跑通;一旦碰到复杂任务,教程里没有交代的背景知识、环境依赖和版本差异就会一个接一个冒出来。你明明原样照搬,结果就是跑不起来,然后开始怀疑互联网都是骗人的。
Astra 的案例也有类似问题。它可以生成代码、脚本和操作指令,这些都是真的,但公开案例通常只展示跑通后的结果,前面准备了什么、用了哪些插件和素材、失败过多少次,几乎看不到。如果你对那个行业完全不熟,可能连问题该怎么描述、结果错在哪里、下一步该改什么都不知道。模型再强,也很难稳定地按照你的预期工作。
我这两天测试了 Blender 和 Audacity,虽然都有点翻车,但却让我看到些更有意思的东西。
Blender测试
Blender[1] 是一款免费、开源的 3D 创作软件,建模、雕刻、动画、材质和渲染等流程都能在里面完成。我这次想测试的也很直接:Astra 能不能替一个完全不懂 Blender 的人,从零做出一个人物模型。
安装 Blender 倒不难,去官网下载安装即可。真正的挑战从打开软件那一刻才开始:满屏按钮和面板,对小白来说是一脸懵逼。

以前想学这种专业软件,兴趣之外还得投入大量时间精力。现在有了 AI,人的胆子也跟着大了起来,比如我。
看多了网上那些近乎“舍弃前置知识”的 Astra 操作 Blender 案例,很容易误以为建模像喝水一样简单(多年的编程经验告诉我,事出反常必有妖。如果真这么简单,AI 早把程序员灭绝了)。

现实很快给了我一巴掌。第一步生成建模就卡住了,后来我又让 Codex 根据参考图调整,结果越来越偏,已经到了不忍直视的程度。
初尝试
首次打开 Blender,我完全没有明确目标,只随手输入了一句:“那你操纵本机的 Blender 构建一些 agent 虚拟体出来,先做一个少女形象,精致的细节。”
Codex 开始卖力工作,很快返回了一张模型预览图。说实话,以我目前的审美,不太能欣赏。

但我万万没想到,一条吐槽帖莫名爆火,甚至得到了好评:

从 Codex 的操作记录可以看出,Astra 主要通过 Python 脚本来完成这次建模。Blender 本身支持脚本自动化,用代码建模也不是什么邪门路线,但想靠一段不断增长的脚本,从模糊描述里捏出一个精致的有机人物,复杂度可想而知。

人物是一个连续的整体。比例、轮廓、五官、材质和光照,任何一处不协调,最后看起来都会很奇怪。至于眼前这个模型到底是哪里出了问题,我只能说“不好看”,却不知道应该先改脸部比例、材质,还是建模路线本身。对模型说“再精致一点”,和对程序员说“做得高级一点”差不多,信息量接近于零。
截图参考
直接给提示词不好用,那就再给张参考图呗。随后我把《凡人修仙传》中的银月截图发给 Codex,让它照着优化建模。新预览图出来时,我有点欲哭无泪。你说不像吧,她既有银发,也有猫耳朵;你说像吧,它似乎正在向“牛来”风格靠近。难道 Astra 已经破解了“牛”量密码?

建模脚本越写越长,我愈发觉得不对劲。看到的不少分享只说 Astra 操控 Blender 完成了建模,至于插件、素材、预设和前期准备,则一概不提。镜头一剪,小白看到的只剩一句提示词和一个漂亮结果,很容易误以为模型足以从零完成任意复杂场景。
如果没有自己的判断力,人很可能被这种案例带进沟里,然后开始怀疑人生:为什么别人一句话做出来那么惊艳,自己折腾半天却一塌糊涂?等这些案例再被自媒体收录、添油加醋,标题就会一路膨胀成 “AGI 已经到来”,焦虑值瞬间拉满。

负向优化
之后我又增加了一些提示词继续优化,效果依然不太如意。更没想到的是,它越调越远,最后朝着非洲狂奔而去...

当然,这口锅也不能全扣在 Astra 头上。我给出的目标本来就很模糊,对 Blender 的建模流程也几乎一无所知。它做偏之后,我能提供的反馈仍然只是“更精致”、“更像参考图”这类空话。专业人士可能一眼就知道问题在哪里,我只知道它丑。
AI 会放大能力,有时也会放大模糊。Astra 确实让我这个外行做出了一个 3D 模型,但它没有顺便把专业人士的判断力塞进我脑子里。
Audacity 测试
Audacity[2] 是一款免费、开源且跨平台的音频录制与编辑软件,可以用来剪辑音频、降噪、转换格式和做一些音频分析。


我拿它做了一个简单测试,本来只是想看看 Astra 能不能操控音频软件,最后吸引我的却不是音乐本身,而是它在后台完成任务的方式。
先抛开最后的音乐效果不谈,这次创作中,Codex 除了使用常见的 CLI 命令,还调用了 FFmpeg,并编写了 Lisp、Python、Swift 等多种语言的脚本来协同处理任务。
这个在我看来就很炸裂!
对程序员来说,学会一门编程语言和学会五门,差距未必有想象中那么大。建立起编程思维后,换语言更多是在熟悉语法、生态和工具,正所谓一法通万法通。但“会几门语言”和“知道什么时候该用哪一门,还能让它们互相配合,把任务做完”,完全是两回事。
这不只是能写、能看懂代码就能做到的。就像会写字,不等于能写出一部文学作品。真正困难的是根据问题选择工具,让不同程序之间正确传递结果,遇到错误后继续调整,最后收敛到一个可以交付的成品。
Astra 这次展现出来的,正是这种跨工具调度能力。图形界面里不好完成的部分,它会转向命令和脚本;一种工具不够,就再拉另一种进来协作。相比单纯看它在 Audacity 里点了哪些按钮,这条隐藏在后台的任务链更让我兴奋。
它也把另一个问题甩回给了人:我们到底能不能定义出一个足够好的问题,给出必要的边界和反馈,让 AI 把这种能力真正用在更大的事情上?如果问题本身是糊的,模型调用再多工具,也可能只是在更卖力地跑偏。



过程比结果更重要
上面三张图有个细节容易被忽略:AI 操作专业软件时,会留下大量脚本、命令记录和中间产物。
过去我们习惯盯着最终成品判断“这是谁做的”。但当 AI 可以批量生成图片、音乐、视频甚至 3D 模型时,只看成品可能越来越难说明问题。反倒是创作过程中留下的东西,更能看出一个作品是怎么长出来的:参考材料从哪里来,脚本如何调整,哪些版本被丢弃,人在什么地方做了选择。
这不代表留几份日志就能解决所有原创争议,但至少它比一张孤零零的成品图提供了更多证据。未来所谓的原创证明,或许不再只是一份最终文件,而是一条可以被回看的创作路径。
从这个角度看,AI 生成的中间垃圾也不全是垃圾。先别急着删,说不定以后真能用上。
门槛在深处
Blender 和 Audacity 的两次测试,让我把注意力从成品转向了过程。暂时没法凭这两个小测试断言 Astra 更适合哪类专业软件,但它们确实让我看清了一层差别:专业工作从来不只是把软件操作一遍,它还包括目标怎么拆、工具怎么选、结果如何判断,以及做错后从哪里改。
Astra 在执行这件事上已经很强。它可以替我点按钮、写脚本、调用工具,甚至自己换路继续尝试。可一旦任务进入审美和专业判断,我缺失的知识不会因为模型会操作软件就自动出现。
所以,我并不觉得这些翻车说明 Astra 不行。恰恰相反,它已经把我从“完全不会操作”推到了“能做出一个东西”。只是从能做到做好,中间仍然隔着一整套专业知识。
以前我卡在不会点 Blender 的按钮,现在我卡在不知道下一步该改哪里。门槛没有消失,只是往里挪了一层。
至少这两天,我依然只能很快说出“这个不好”。至于怎样才算好,我还在学。
二、Astra 注意事项
截图里提到 Astra 一个很奇怪的能力退步:它经常停在“下一步”。明明发出的是一条希望它直接执行的指令,它却只简短回复几句,告诉你接下来应该做什么,然后就不动了。

这两天实测时,我也反复遇到同样的问题。相比 Sol,Astra 用起来没那么丝滑——它很会告诉你下一步该做什么,却不一定真的继续执行。起初我以为这只是主观体感,翻过 Codex 源码后才发现,事情并没有那么简单。
Astra 和 Sol 的差别不只是能力高低,做事方式也变了。Sol 通常会顺着上下文补全用户意图:即使要求没有写得特别明确,它也往往先动手,做到需要决策的地方再调整。Astra 更在意边界、授权和结果是否可靠。只要它判断某项缺失信息可能改变结果,就更容易停下来等待确认。在用户看来已经足够明确的一句话,到了 Astra 那里,可能只换来一段任务理解和一句“下一步应该……”,实际动作却没有发生。
这不像是 reasoning 或工具配置造成的。Codex 中 Astra 和 Sol 的默认 reasoning、verbosity、tool mode、multi-agent 版本基本一致。OpenAI 的模型说明直接提到,Astra 比 Sol 更倾向于请求澄清;当用户希望它自行补全细节并继续时,它可能停住。它对上下文指令也更敏感,AGENTS.md、skills 等文件里只要存在含糊或相互冲突的规则,就可能让它提前收手。
源码处理方式也说明,官方已经预料到这种差异。Astra 没有沿用 Sol 的基础指令,而是配了一套更长的专属 agent prompt。里面甚至明确写着:can you、I want to、help me 这类表达应当视为行动请求;不要只做确认、给出计划,或者告诉用户之后可以继续。换句话说,这些提示是在纠正 Astra 容易“解释完就收工”的倾向。
让人明显感觉像一次回退,还有个直接原因:Astra 上线后成了默认模型。用户没有改变提示词和操作习惯,但未固定模型的新任务已经从 Sol 切换到了 Astra。入口没有变,背后的意图判断变了。同一句话,Sol 可能直接执行,Astra 则可能先判断是否还需要确认。
老任务中途切换到 Astra 时,情况还可能更复杂。Codex 会保留旧模型的 base instructions,再通过 developer message 注入 Astra 的完整指令。对上下文更敏感的 Astra 来说,多套指令叠在一起,更容易产生保守解读。这个机制不能单独证明中断的原因,却是一个值得优先排查的放大因素。
所以,概括来说:Astra 的加入确实改变了 Codex 默认 agent 做事方式。用户感受到的卡顿和不连贯有明确的模型行为依据,并非单纯心理作用,也不是源码刻意削弱了执行能力。问题主要来自三点:Astra 对用户意图的判断更谨慎,对多层指令更敏感,上线后又直接接替 Sol 成为默认模型。Codex 已经用专属 prompt 做了补偿,但在公开源码中,还没有看到专门覆盖“只说明下一步,却不实际行动”这一问题的 Astra 行为回归测试。(参考链接:Using GPT-6 Astra[3]、openai/codex[4])
三、结语
写完前面的 Blender 和 Audacity 测试,恰好又刷到几条帖子。几个人谈的角度不同,放在一起却刚好能接住我这两天对 Astra 的感受。
2020 年 8 月,Elon Musk 看到初代 GPT 到 GPT-3 的进步速度后曾判断:如果这种速度继续保持,GPT-5 或 GPT-6 可能会强到与最聪明的人类难以区分。他当时特意强调,这只是个人观点,并非替 OpenAI 背书;自己已经离开 OpenAI 两三年,只是一名中立的外部观察者。几年后再看 Astra,这个判断有了更具体的参照:Pietro Schirano 把 Astra 称为有史以来最强的逆向工程引擎,因为它能把图片、视频等媒介转化为代码,也能观察现有软件并尝试复现其功能和视觉效果,大幅缩短从“看见”到“造出来”的距离。
复制一个结果正在变得越来越容易,但 Paul Graham 认为,人也不必因此否定一个容易被复制的初始想法,因为创业点子真正的价值,往往来自实践过程中继续生长出来的新想法。Ethan Mollick 则提醒,Astra 或 Fable 的能力也不能脱离具体使用者来评价:它们会在本地文件中记录用户信息、查看用户过去的工作,并据此推测个人偏好,因此即使使用同一个模型和提示词,不同的人也可能得到不同结果,横向测评自然会受到影响。
把这些观点放在一起,并不能证明 GPT-6 已经与最聪明的人类没有区别,但至少说明了一件事:AI 越来越擅长复现已有结果,而人的长期积累、判断与继续产生新想法的能力,并没有因此消失。


References
[1]Blender:https://www.blender.org
[2]Audacity:https://www.audacityteam.org
[3]Using GPT-6 Astra:https://developers.openai.com/api/docs/guides/latest-model
[4]openai/codex:https://github.com/openai/codex
本文来自微信公众号:浮之静,作者:lencx
