新研究:AI搜索工具平均准确率仅六成,且自信满满“不认错”
创始人
2025-03-13 20:48:43

IT之家 3 月 13 日消息,据外媒 Techspot 周二报道,哥伦比亚大学数字新闻研究中心(Tow Center for Digital Journalism)近期对八款 AI 搜索引擎展开研究,包括ChatGPT Search、Perplexity、Perplexity Pro、Gemini、DeepSeek Search、Grok-2 Search、Grok-3 Search 和 Copilot。研究人员测试了每款引擎的准确性,并记录了它们拒绝回答问题的频率。

研究人员从 20 家新闻机构中随机挑选了 200 篇报道(每家 10 篇),确保它们在谷歌搜索时能排在前三位,然后用相同的查询方式测试各 AI 搜索工具,并评估它们是否正确引用了文章内容、新闻机构名称和原始链接

测试结果显示,除 Perplexity 及其付费版外,其余 AI 搜索引擎的表现都不尽如人意。整体来看,AI 搜索引擎提供的答案有 60% 是不准确的,而且 AI对错误答案的“自信”反而加剧了问题。

这项研究的重要性在于,它用数据印证了外界多年来的担忧 —— 大语言模型仅会出错,还擅长一本正经地胡说八道。它们往往以绝对肯定的语气陈述错误信息,甚至在被质疑时仍然试图自圆其说。

即使承认了错误,ChatGPT 仍可能在后续回答中继续编造内容。在大语言模型的设定中,几乎是无论如何都要给出答案”。研究数据支持了这一观点:ChatGPT Search 是唯一回答了所有 200 个新闻查询的 AI 工具,但其“完全正确”率仅 28%,而“完全错误”率高达 57%

ChatGPT 并非表现最糟的。X 旗下的 Grok AI 表现尤为不堪,其中 Grok-3 Search 的错误率高达 94%。微软 Copilot 也问题重重 —— 在 200 次查询中,有 104 次拒绝作答,剩下的 96 次中,仅 16 次“完全正确”,14 次“部分正确”,66 次“完全错误”,总体错误率接近 70%

这些 AI 工具的开发公司并未公开承认这些问题,却仍向用户收取每月 20 至 200 美元(IT之家备注:当前约 145 至 1449 元人民币)的订阅费。此外,付费版 Perplexity Pro(20 美元 / 月)和 Grok-3 Search(40 美元 / 月)比免费版回答得更多,但错误率也更高。

相关内容

热门资讯

实测教程!(wePoKer)辅... 亲,有的,ai轻松简单,又可以获得无穷的乐趣,来玩是你和朋友度过闲暇时光的不二选择,赶紧来尝试一下吧...
四川水电龙头换帅!刘胜金接棒川... 12月30日,四川水电龙头川投能源(600674)完成董事会换届,迎来新任董事长刘胜金、副董事长黄强...
我来教大家“(德扑之星)外挂究... 我来教大家“(德扑之星)外挂究竟是真的吗”(爆光开挂猫腻)里面包含了5中不同的软件透明挂,分别是(德...
实测攻略!欢乐掌心麻将辅助挂作... 亲,欢乐掌心麻将有的,ai轻松简单,又可以获得无穷的乐趣,欢乐掌心麻将是你和朋友度过闲暇时光的不二选...
实测攻略!粤乐广东麻将辅助挂作... 您好,粤乐广东麻将这款游戏可以开挂的,确实是有挂的,通过微信【29290261】很多玩家在这款游戏中...
实测攻略!开心安徽比鸡辅助挂作... 实测攻略!开心安徽比鸡辅助挂作弊教程,太坑了原来有挂(有挂总结)-哔哩哔哩是一款可以让一直输的玩家,...
我来教大家“Poker Mas... 我来教大家“Poker Master外挂究竟是真的吗”(爆光开挂猫腻)是一款可以让一直输的玩家,快速...
实测攻略!乐逍遥跑胡子辅助挂作... 实测攻略!乐逍遥跑胡子辅助挂作弊教程,太坑了原来有挂(有挂总结)-哔哩哔哩是一款可以让一直输的玩家,...
分享使用教程!wePoKe辅助... 透视辅助!传奇德州辅助透明挂,wepoke详细教程(2025已更新)-哔哩哔哩是一款可以让一直输的玩...
分享实测辅助∶同城字牌辅助器脚... 分享实测辅助∶同城字牌辅助器脚本”!详细开挂教程(包教包会),同城字牌是一款可以让一直输的玩家,快速...