一道小学生难度的数学题难倒了一众海内外AI大模型。
9.11和9.9哪个更大?就此问题,记者测试了12个大模型,其中阿里通义千问、百度文心一言、Minimax和腾讯元宝答对,但ChatGPT-4o、字节豆包、月之暗面kimi、智谱清言、零一万物万知、阶跃星辰跃问、百川智能百小应、商汤商量都答错了,错法各有不同。
大部分大模型在问答中都错误地比较了小数点后的数字,认为9.11大于9.9,考虑到数字涉及的语境问题,记者将其限定为在数学语境下,如ChatGPT这样的大模型也照样答错。
在这背后,大模型数学能力较差是长期存在的问题,有行业人士认为,生成式的语言模型从设计上就更像文字思维而不是数字思维。不过,针对性地语料训练或许能在未来逐步提升模型的理科能力。
女巨人最巨大的是哪里?请你不要到处扣扣的囧图
对巨乳不感兴趣的是没碰到自己的 满足于烧鸡的囧图
什么样的腿才是完美腿型?大幂幂是真的大的囧图
劳拉新形象太丑胸围被大砍!祖国人看了都没食欲
国产大作湮灭之潮登央视!中国游戏也能讲国际故事
全新国产虚幻5《鲲歌》首曝!能打篮球 3D动作肉鸽