一个模型被问:“会织网的动物有几条腿?”它回答8。问题里没有出现“蜘蛛”,但模型内部其实已经判断这个动物是蜘蛛。研究者没有改动问题,只把模型内部“蜘蛛”的表示换成“蚂蚁”,答案就变成了6。也就是说,在AI说出答案之前,它内部可能已经完成了我们看不到的判断和推理。但大模型究竟如何一步步得到答案,至今仍没有清楚的答案。
本期视频,我们与AI可解释性研究者Aryaman Arora聊聊,研究者如何“打开”AI黑箱:思维链是真正的思考过程吗?模型内部会形成对世界的理解吗?我们能否通过观察和干预模型,找到它做出判断的原因?即使开始看懂模型,也不意味着我们已经有能力修改它。有时,AI为什么做对一件事,反而比它为什么犯错更容易解释。
我们也聊到了AI正在呈现的新变化:模型会根据对用户的判断调整回答,也逐渐表现出不同的“性格”。可解释性的意义,不只是“看懂”AI,更是理解它为何这样判断、是否值得信任,以及我们应该在多大程度上把重要决策交给它。随着模型能力增强,理解AI也正变得越来越重要。