AI购物代理仍缺乏可靠判断
The Decoder··作者 Matthias Bastian
关键信息
在一项测试中,只加入一个外部来源就足以翻转推荐结果,而加入更多来源并没有让代理更稳定,反而增加了波动性。研究还发现明显的顺序效应:Gemini 3.1 Flash Lite 会因来源顺序不同而大幅波动,而 GPT-5.5 在来源打包呈现和逐个呈现时的反应也明显不同。
资讯摘要
沃顿商学院的研究人员考察了,当购物上下文发生变化时,AI 购物代理的行为到底有多一致。研究使用了 ACES,也就是 Agentic e-Commerce Simulator,它会向模型展示商品页面截图,并允许模型在选购前可选地参考推荐来源。团队测试了六个当前模型,包括 mini 版本和更强的前沿模型,任务是从固定的商品网格中挑选一款健身手表。第一项实验发现,即使只加入一个外部来源,也足以让代理的选择与基线结果出现显著变化。第二项实验中,增加到两个或三个来源并没有让结果相互抵消,反而在某些情况下让波动更大;当 Wirecutter 出现在信息组合中时,它往往会主导多数模型的决定。
第三项实验进一步证明,同样的三条来源信息,只要呈现顺序不同,最终结果就会不同,这说明展示顺序本身就是影响决策的因素。Gemini 3.1 Flash Lite 尤其敏感,而 Claude Haiku 4.5 相对稳定;GPT-5.5 在来源打包呈现和按顺序逐个呈现时,表现也明显不同。第四项实验里,研究人员把商品网格改成让某一款产品在所有可量化指标上都明显更优,然后加入诸如“我喜欢徒步!”这样的简短记忆语句,结果部分模型仍会被这些记忆提示带偏,转向更贵的产品。作者因此认为,当前 AI 购物代理还不够一致,无法可靠地代表用户自主购买,而卖家要针对 AI 购物做优化,也会比传统 SEO 更困难,因为他们无法知道是哪一个模型在购物,也不知道它之前看过什么上下文。

资讯正文
AI购物代理还没准备好替你下单,研究发现
宾夕法尼亚大学沃顿商学院的研究人员测试了当搜索过程发生变化时,AI购物代理推荐产品的一致性。即便是极细微的上下文变化,也会让购买决策大幅摆动。
研究团队测试了六个当前模型,包括 mini 版本和前沿级别模型,要求每个模型扮演个人购物助手,从固定的产品网格中挑选一款健身手表。他们使用了 ACES 模拟器(Agentic e-Commerce Simulator,代理式电子商务模拟器),该工具会向 AI 代理展示一张产品页面截图。代理分析图像,必要时调取推荐来源,然后选择一款产品。
单一来源就足以扭转推荐结果
即使没有外部来源,这些模型也表现出不同的基础偏好。但当代理在产品页面之前只看到一条外部来源时,在某些情况下,推荐结果会戏剧性地改变。
在第二个实验中,代理会看到两到三条来源的组合。不过,多条来源并没有起到平衡推荐的作用。研究显示,只要 Wirecutter 出现在组合中,它往往就会主导多数模型,尽管这种影响强度各不相同。实际上,来源越多,变异性反而越大。
即使相同来源的顺序不同,结果也会改变
在第三项研究中,代理以不同顺序接收全部三条来源。稳定的决策过程在输入内容完全相同的情况下应该产生相同结果,但事实并非如此。
Gemini 3.1 Flash Lite 对顺序最为敏感,其选择 Fitbit Inspire 3 的概率会根据来源顺序不同,在对照条件基础上上下波动 2 到 56 个百分点。Claude Haiku 4.5 则保持稳定,波动维持在 41 到 42 个百分点。研究人员得出结论:呈现顺序本身就是影响产品选择的驱动因素。
来源是逐条输入模型,还是一次性打包输入,也同样重要。GPT-5.5 在打包传递时,选择 Fitbit Inspire 3 的比例高出 53 个百分点;而在按顺序逐条传递时,这一增幅只有 6 个百分点。
记忆片段会压过客观上的产品优势
在第四个实验中,研究人员修改了产品网格,使其中一款产品在每一项可量化维度上都占优:一款带 Alexa 的智能手表,售价 29.99 美元,评分 5.0/5.0,拥有 430 条评价。其他所有产品的价格都至少为 359 美元,评价数量也更少。
随后,他们加入了类似“我喜欢徒步!”这样的简短用户记忆陈述。对若干模型来说,这些陈述会让选择转向更昂贵的产品,尽管页面上已经存在一个客观上更优的选项。Claude Opus 4.8 选择 Garmin Vivoactive 5 的比例上升了 75 个百分点,GPT-5.5 上升了 37 个百分点,Gemini 3.1 Flash Lite 上升了 36 个百分点。
Gemini 3.5 Flash 的抗干扰性最强,无论是否加入记忆陈述,它在 86% 到 92% 的运行中都会选择客观上最优的产品。GPT-5 Mini 则表现出一种奇怪的模式:正向的徒步陈述并没有让它显著更倾向于 Garmin Vivoactive 5,但负向陈述(“我不喜欢徒步!”)却显著提高了它选择 Fitbit Versa 4 的概率。
没有一致性,也没有控制
对购物者来说,这项研究表明,让一个 AI 代理代你购买,并不能保证购买决策始终一致或最优。对于同一个查询,或者同一个用户在不同日子提出相同查询,系统可能会给出不同的产品推荐,而且没有明显原因。人类的购买决策也并不一致,但人们对 AI 购物助手显然不会抱有这样的期待。任何曾在 ChatGPT 或类似工具中设置过记忆功能的人也应该知道,它会以难以预测的方式影响购买推荐。
研究人员表示,对卖家而言,这些结果意味着,针对 AI 购物进行优化将比传统 SEO 更困难。卖家不知道究竟是哪一个模型在代为购物,不知道它之前读过什么,也不知道其技术设置是如何处理信息的。
来源与参考
收录于 2026-08-28