本文来自微信公众号:不允法典,作者:Neil,原文标题:《从一句模糊指令到131张可连续翻阅的聊天截图,我是怎样不断纠正AI的》,头图来自:AI生成
AI交给我一份质量报告,其中一项写着,未展开语音为0。
但我打开它生成的截图,画面里清楚地摆着一条17秒的语音,下面没有任何转写文字。
事情要从两段微信聊天录屏说起。
我想把它们整理成一页一页的聊天记录图片。这些图片后面要用来梳理事情经过,也可能进入证据材料。我希望每一页都能读、前后接得上,而且可以回到原始录屏找到出处。
我原以为这只是一次视频抽帧。
结果做了四轮。
第一轮:先确认方案,仍然漏掉了语音
第一轮,我并没有让AI直接执行。我已经在Prompt里要求它先说明技术方案,等我确认后再开始。
PROMPT 01 · 第 1 轮补充指令:
请把两段聊天录屏整理成一页一页的聊天记录图片,去掉重复画面,按照聊天顺序编号保存。请先确认好技术方案、风险和验收方式,等我确认后再执行。
AI先给出了方案。我确认后,它很快完成了第一版。
文件夹里生成了一批截图,还有一份质量报告。报告写得很完整,其中一项显示,未展开语音为0。
但事实是,当我打开文件夹后,几乎一半以上的截图存在语音转文字的加载圆圈或者跳跃截图的情况。
尽管已经让他确认了方案,但方案里并没有把“语音只有时长、没有文字是否合格”变成可执行的检查规则。第一轮的问题不是没有先讨论方案,而是方案仍然停留在处理步骤,没有真正落到验收标准。
所以第二轮开始了。
第二轮:把“合格”改成可以执行的规则
第二轮,我没有让它继续批量截图,而是先重新定义交付物。
我把结果拆成了三层。忠实版按源视频顺序保留稳定画面,阅读版要求所有可见语音均已转写并能连续翻阅,全屏打开的图片则单独保存为附件展开图。
然后我补充了第二条指令。
PROMPT 02 · 第 2 轮补充指令:
阅读版中,所有可见语音都必须已经显示转写文字。发现未完成语音后,不要只删除页面,请回到原视频寻找同一语音已经转写完成的后续画面。
聊天界面会经历滚动、停止、转写加载和自动跳位,因此要找的不是“每隔几秒的一帧”,而是稳定、无遮挡且转写完成的界面状态。
第一轮中还出现了一条连加载圈都没有,完全没有转写的空白聊天框截图。核对后,很容易发现:语音之所以会漏检,是因为第一版程序只检查空白转写框。可这条语音连转写框都没有出现,程序没有发现空白框,于是把它判定为合格。
后来,语音检查被拆成三道门,空白或加载中的转写框、语音气泡下方是否真正出现文字,以及语音区域里的处理圆环。三项全部通过,页面才能进入阅读版。
发现不合格页面后,也不能直接删除。
因为页面上半部分可能包含前一页之后的新内容。整页删除虽然消除了未转写语音,也可能同时删掉一段聊天。
正确的做法,是回到源视频继续向后寻找完成画面。如果上半部分已经合格,下半部分露出未完成语音,则可以在第一个不合格组件之前做顶部连续裁切。裁切只能减少显示范围,不能移动或重排聊天内容,并且必须记录坐标。
第三轮:用共同内容证明页面连续
但很纠结的是语音问题解决后,重复页面和页间断裂仍然存在。
于是我继续增加了一条连续性要求。
PROMPT 03 · 第 3 轮补充指令:
相邻两页必须保留同一条消息、同一张图片或者同一个时间锚点。不能因为背景、头像和输入框相似,就判断页面连续。
聊天页面轻微滚动时,同一批消息会整体上移。AI需要先对齐共同内容,再判断新增部分是否足够多,从而去掉只有小幅滚动的重复页。
微信聊天页面具有相同的标题栏、背景和输入框。即使两张图来自不同位置,整体相似度也可能很高。页面相似并不等于内容连续。
上一页里的哪一条消息、哪一张图片或者哪一个日期,在下一页里仍然看得见?
只有能够指出具体的共同锚点,才能确认两页连续。
如果两个关键页面不能直接接上,AI就回到中间的源视频帧里寻找桥接页面,而且每一步都必须共享真实内容。
第二段录屏的末尾还滚回了较早内容。忠实版继续保留源视频顺序,阅读版则只有在找到共同锚点后,才把回滚页面调整到正确的阅读位置。
第四轮:不存在的连续,不能靠语义补出来
第三轮后,大部分页面已经能够衔接。但微信展开较长语音的文字时会自动跳位,跳动前保留上文,跳动后出现下文,而录屏中没有同时包含两边的完整画面。于是我补充了第四条边界。
PROMPT 04 · 第 4 轮补充指令:
如果源视频中找不到能够证明连续的画面,不要凭聊天语义强行连接。可以明确标注缺口,也可以分段,但不能生成一张看似完整、实际并不存在的普通聊天截图。
最终方案是制作明确标注的双源帧过渡页。页面上下分别来自跳动前后的源帧,中间说明发生过自动跳位,清单同时记录两个来源及其裁切坐标和哈希。
两段录屏之间同样处理,没有共同画面就分段,不凭聊天语义补出连续关系。
把每一个真实错误写成回归测试
四轮处理完成后,我又让AI分别复核图片结果和处理逻辑。前者检查未转写语音、重复页面、顺序跳跃和页间锚点,后者检查圆环、深色照片和相似页面是否可能造成误判。
每发现一个真实错误,就把它写成一项回归测试。
最后,两段录屏生成了195张忠实版截图、131张阅读版截图和6张附件展开图。阅读版中,未展开文字的可见语音、空白转写框和语音区域处理圆环均为0。同一视频段内,相邻页面没有共同锚点的情况也为0。
整个项目最终形成了43项回归测试。
一段可以直接使用的起步指令
如果你也想让Codex或Claude Code处理类似材料,可以直接从下面这段指令开始。
PROMPT 05 · 完整起步指令:
请将聊天录屏整理为忠实版、连续阅读版和附件展开图。开始处理前,先复述技术路线、允许的派生处理、失败条件和最终验收标准,等我确认后再执行。确认方案后,先处理一小段录屏并提交示例页面。等小样通过验收,再处理剩余材料。阅读版中,所有可见语音必须显示转写文字,不得出现空白转写框、加载圆环、长按菜单或操作弹窗。
相邻页面必须共享同一条消息、图片或时间锚点,不能仅凭聊天背景和页面布局相似判断连续。发现不合格页面后,不要只删除,请回到源视频寻找完成状态或桥接帧。需要裁切时,只允许顶部连续裁切,并记录裁切坐标。
如果源视频因语音转写发生跳位,可以制作明确标注、双源帧可追溯的过渡页。如果仍然无法证明连续,请分段,不要凭语义强行拼接。不得改名、移动或覆盖源视频。请记录源视频哈希,并让每张输出图片都能追溯到源视频、源帧和源视频时间。任一硬性质量门槛没有通过时,不要报告任务已经完成。
真正值得保留的,不是某一个万能Prompt
我一开始就要求AI先确认技术方案再执行,最后仍然跑了四轮。原因是,执行前的讨论只能覆盖当时已经意识到的问题。语音没有出现转写框、录屏中根本不存在桥接帧,这些边界只有真正处理材料以后才会暴露。
如果重新做一次,我会先和AI确认交付版本、页面合格标准、连续性证明和缺口处理方式,然后只处理一小段录屏。小样通过检查后,再运行完整批次。
复杂任务不必追求一个万能Prompt。更有效的节奏是,先讨论验收标准,做小样,从结果中发现问题,让AI回到源材料修复,再把这次纠错沉淀为规则和回归测试。
一个Prompt不能解决所有问题,但每一轮都可以让下一轮少犯一次已经见过的错误。
本文来自微信公众号:不允法典,作者:Neil
