**马里兰大学与Google DeepMind研究显示,通过分析叙事结构(人物、情节、时间安排)而非词汇句式,分类器区分AI与人类小说的准确率达93.2%。AI故事倾向主题解释、无支线、包饺子结局,且这些特征比表面用语更难洗掉。** **要点** **1. 叙事结构识别AI准确率超93%** 研究从Books3中提取10272篇人类短篇小说,让五个AI重写,提取304项叙事特征(人物是否主动解决问题、冲突升级方式、时间跳跃等),不依赖具体用词。分类器区分人类与AI故事的macro-F1达93.2%,表明AI写作的骨架比表面用语更稳定。 **2. AI故事普遍存在“说透”倾向** AI叙述者有77%概率亲自解释主题(人类52%),59%用对话讨论人生道理(人类34%)。79%的AI故事没有支线(人类57%),更常使用倒叙、插叙和时间跳跃的反而是人类作者。AI还倾向于让主角做出明确决定来闭环故事(69% vs 46%),即“包饺子”结局。 **3. AI对情绪描写过于“八股”** AI有81%概率通过身体反应和隐喻表达情绪(如恐惧时胸口收紧、冷汗渗出、灯光暗下),人类反而更可能直接写“他害怕了”(仅38%采用细节表达)。不同模型有细微差异:Claude结局安静,GPT爱用八卦推动剧情,Gemini结尾干净,DeepSeek早交代关键信息,Kimi最接近AI叙事中心。 **4. 去AI味处理仅降低1.6%识别率** 对278篇Gemini故事进行删改(删除陈词滥调、冗余解释),词句变化后识别率仅从95.5%降至93.9%。因果链、主题解释和结局收束未改变,说明叙事结构比词汇句式更难被洗掉,这也是读者感到“别扭”却难以指出的根源。
“AI味”不是在一句话里,而是渗透了所有的文字
2026-08-29 17:07

“AI味”不是在一句话里,而是渗透了所有的文字

本文来自微信公众号: APPSO ,作者: APPSO ,原文标题:《“AI 味”不是在一句话里,而是渗透了所有的文字》,题图来自:AI生成


相信很多人现在见到“不是……而是”,已经会下意识 PTSD 了:这是不是 AI 写的?还有各种破折号,冒号,以及经典版本“稳稳地接住你”“我用最直白的话,不绕弯子地告诉你”……


当然,这些不断被总结出来的“AI 用语”也在不断失效,可能是模型升级一次,或者让另一个模型改写一遍,常见词汇、句式和标点都可以被洗掉。来自马里兰大学和 Google DeepMind 的一组研究者于是换了一个问题:如果完全不看遣词造句,只看一篇作品怎么安排人物、情节和时间,还能认出 AI 吗?


能的,兄弟,能的,甚至有些 AI 的写作习惯,比它爱用哪些词更稳定。


给五个 AI 同一道作文题


这项名为 StoryScope 的研究考察的是 AI 在英文虚构方面的写作,研究者先从 Books3 中取出 10272 篇人类创作的短篇小说,再从每篇小说反推出一道包含相似人物、设定与主题的写作题,分别交给 Claude、DeepSeek、Gemini、GPT 和 Kimi 重写。算上原作,最终得到 61608 篇平均约 4753 词的故事。



接下来,研究者把所有文章拆成一张张“叙事体检表”:人物是否主动解决问题,冲突如何升级,故事是否穿插支线,时间有没有跳跃,秘密在什么时候揭晓,结局是否留有余地……十个维度一共提炼出 304 项特征,但不再记录某个词用了几次、句子有多长。


只凭这些看不见文风的叙事特征,分类器区分人类与 AI 故事的 macro-F1 就达到 93.2%。换句话说,AI 即使换掉表面的语气,故事的骨架仍然可能暴露自己是 AI。



AI 太努力,也太完整


在这些样本里,AI 最明显的习惯是把意思说透。AI 叙述者有 77%的概率亲自解释主题,人类作品为 52%;AI 还更爱让人物借对话讨论人生道理,比例达到 59%,人类只有 34%。一个角色经历悲伤之后,故事往往还要替他总结究竟学会了什么。



情节也更像一道必须完整作答的题:79%的 AI 故事没有支线,人类作品为 57%,乍一听上去还有点反直觉,拥有所有统计树可能性的 AI 反而不爱写支线。


反而人类作者则更愿意把故事弄乱一点,使用更多倒叙、插叙和时间跳跃,留下彼此平行的支线,也更常把主角放在道德不明确的位置。以最近热门的国漫《八仙!》为例,所有人物都是“不完美”主角,观众也会因为观看他们的遭遇,而在自己心里反复立场横跳。


当反转揭晓,AI 更倾向于让人物获得理解、接受现实,简单来说就是 AI 也爱“包饺子”结局。69%的 AI 故事里,模型喜欢让主角做出一个明确决定,并让这个决定成为故事闭环的钥匙。人类作品中这一比例为 46%,更常让偶然、他人和环境共同左右结果,甚至容许主角做一些看上去“啥也不是”的决定。


比如诺兰执导的电影版《奥德赛》,对原著进行了现代化的重构,将重点放在了战争创伤与自我救赎上,结局也发生了颠覆性的改变,这使得观众重新理解这个古老的故事,当然也引发了争议。


描写中,AI 把“不要直接说感受,要展示感受”执行得过于认真,它有 81%的概率,直接通过描写用身体反应和隐喻表达情绪,而且特别“八股”:写恐惧时,胸口要收紧,冷汗要渗出,拳头要握紧,灯光要暗下来。


人类反而更可能直接写一句“他害怕了”,只有 38% 概率要借助更细节的表达。


不同的模型也有不同,勉强可以称为“风格”不同吧。Claude 的冲突升级最平缓,偏爱尾声和安静的结局;GPT 喜欢让八卦与传闻推动剧情;Gemini 喜欢干净整洁的结尾;DeepSeek 习惯早早就交代关键信息;Kimi 的个性最少,处在 AI 叙事分布的中心。



但整体来看,这些都差不多,从分布图上能看到,五个模型的故事集中在相近的叙事区域,人类作品则分布得更远、更离散。在全部故事中,24.7%的人类作品进入“最罕见的 10%”,AI 作品只有 7.1%。


“AI 味”从来不在某一句话里


研究者还特意给 278 篇 Gemini 故事做了一轮去 AI 味处理,删掉陈词滥调、冗余解释和华丽废话,改写之后,依靠叙事结构的识别成绩仅从 95.5%降到 93.9%。词句变了,因果链、主题解释和结局收束却没有一起改变。



这也是为什么可能你看某个 AI 生成的小短文,开头没察觉,进入情节也没察觉,但看到最后,总觉得哪儿哪儿透着一股别扭,一琢磨:这会不是 AI 写的吧!


这项研究只证明了英文虚构故事里的差异,不能直接拿来判断新闻、评论或者公众号文章等其它更丰富的写作体裁,但它提供了一个比寻找“AI 口头禅”的更深远的角度。


一直以来,我们习惯从具体行文鉴 AI,爱用破折号,频繁使用“并非……而是”,每一节都规整地提出问题、给出解释、上升价值。这些观察没有错,只是它们抓到的可能是最容易被修改的一层,只要模型学会禁用某个词、打散几个句式,这套清单便会迅速过期。



更难洗掉的,也许不是 AI 怎么写一句话,而是它认为什么值得写。在议论文体例里,它是不是急着把主题摆出来,是否把复杂问题压成单线因果,结尾是不是爱替读者总结意义,又是否允许一篇文章留下无用的支线、没有解释的细节和无法闭合的矛盾。


到了这一层,鉴 AI 远不只是从文章里圈出几个可疑词汇,需要读者留心整篇文章如何被构想出来——在今天快餐阅读的时代,连读完两千字都已经并不容易,对整体性有感受可谓是难上加难。


可是这种“整体性”其实更重要,我们习惯于纠缠在字和句上,却忽略了文字作品里,谋篇与布局才是真正承载着作者思考和表达的通路。


《文心雕龙》里说,“意授于思,言授于意,密则无际,疏则千里”,意思是:写作是从思考到意旨,再从意旨落实为语言;两者之间紧密相连,可以浑然无间,而小小的疏忽,最终也可能让表意相差千里。

AI创投日报频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP