一项最新研究表明,人工智能目前尚无法完全接管假日购物任务。

产品验证初创公司 Product.ai 本周发布的研究指出,由 AI 驱动的购物助手在价格、产品规格及新品识别等方面,经常给出相互矛盾的答案。该研究对 ChatGPT、Claude、Gemini 和 Perplexity 的免费及付费版本进行了测试,涵盖笔记本电脑、电视等品类的 220 个购物问题。每个服务运行五次,共收集 8,794 条回复。

高频率的事实冲突

研究发现,86% 的问题产生了可重复的事实冲突,即多次回复中出现不同的价格、型号或规格。在要求比较两款产品的直接对比类问题中,冲突率高达 97%,远高于简单事实问题的 75%。

在价格准确性方面,模型表现同样不佳。在可核实的 913 个答案中,仅 85% 与当前或标价相符。当答案出错时,价格偏差的中位数为 300 美元。

模型表现差异显著

不同大型语言模型之间存在明显差异。Gemini 在被归类为“严重错误”的问题中占比最高,免费版本达 56%,付费版本为 54%。此外,Gemini 免费版在 29% 的问题中出现自相矛盾的情况,比率为所有模型中最高。

Claude 的表现随付费版本有所改善,严重错误率从 44% 降至 21%。Perplexity 的严重错误率最低,其付费版本仅为 14%;ChatGPT 付费版本紧随其后,为 17%。Perplexity 发言人称其在准确性指标上处于行业领先地位,其他三家模型代表未回应置评请求。

建议:作为辅助而非代理

Product.ai 搜索产品负责人 Dakota Nunley 表示,大型语言模型在处理端到端购物体验方面尚未成熟,巨大的价格差异足以让购物者产生顾虑。

Nunley 建议,用户不应直接将支付细节交给 AI 代理,而应自行核实信息,包括向多个引擎提问比较结果或直接检查卖家网站。“在接下来的假日购物季,请将人工智能作为发现工具和思维伙伴来使用,但此刻要警惕完全放手不管。”他说。