9.11比9.9大？多个大模型翻车！业内人士：就是偏科，文科强理科弱。-虎嗅网

717

AI新技能

机器人们又get了什么新本领？

9.11比9.9大？多个大模型翻车！业内人士：就是偏科，文科强理科弱。

据北京商报，近日，在新一期的《歌手》节目中，孙楠与外国歌手的微小分数差异，引发了网友关于13.8%和13.11%谁大谁小的争论。有网友竟给出“13.11%大于13.8%”的错误答案。当时就有网友提出，自己不会的话，“实在不行问问AI呢”？结果显示，不少AI还真的不行。

第一财经记者拿“9.11和9.9哪个大”的问题一一测试了ChatGPT以及目前国内的主流大模型，包括阿里、百度等5家大厂模型，月之暗面等6家AI独角兽的模型。阿里通义千问、百度文心一言、Minimax和腾讯元宝4家大模型答对，其他8家则答错。

目前全球公认第一梯队的大模型ChatGPT，在被问到“9.11和9.9哪个大”时回复称，小数点后面的数字“11大于9”，因此9.11大。

这类大模型说胡话的现象，在业界被称为大模型出现幻觉。大模型可能会过度依赖训练数据中的一些模式，如位置接近性、共现统计数据和相关文档计数，从而导致幻觉。此外，大模型还可能会出现长尾知识回忆不足、难以应对复杂推理的情况。

业内人士向南都记者表示，目前来看大模型的数理能力相对较差的情况在中外都是一样的，“打个比方可以这样讲，大模型就是偏科，文科强理科弱，这个情况在一段时间内也不会得到明显的改善”。

2024-07-17

415