
AI推荐的“最佳软件”,像被刷出来的样本
我注意到一个有意思的细节:三个站做了 215,128 个“最佳软件”页面,Perplexity 却把它们当成来源引用。报道里说,跨 380 个软件类别,59.8% 的 grounding 来源背后是这种制造页面。我的结论先放这儿:这不是 AI 学会了挑软件,而是检索引用层被供给方优化了。它像回测很漂亮的模型,一实盘,滑点立刻把收益吃干净。
之前我写过,AI 有严重幻觉,不适合直接给管理层做决策。现在看法更硬:问题不只是胡说,而是它引用的“事实”可以被工业化生产。页面数量多、标题像评测、结构方便抽取,就可能进入引用池。屏幕上跳出几个链接,看起来像背书;对模型来说,可能只是高频供给出来的统计噪声。
这不是幻觉,是引用层被污染
量化里有个老问题:数据生成过程本身会改变结果。订单簿堆满虚假挂单,价格信号会被污染;训练集混进未来信息,回测夏普比率会高得离谱。Perplexity 依赖可检索网页,网页可以被批量制造,类别可以被模板化覆盖,措辞可以被优化成最容易被引用的样子。
215,128 页覆盖 380 个类别,平均每个类别超过 500 页。这个密度不像自然内容,更像定向投放。它不需要真实用户点击,只要足够容易被机器抓取、足够像 FAQ、足够覆盖 best software、comparison、reviews 这类词,就可能获得引用。这个模型的夏普比率不能只看推荐命中率,还要看来源稳定性、重复度、独立性和集中度。
59.8% 也意味着很多类别共享同一类来源。你以为是多个网页交叉验证,实际可能是同一种页面结构互相复制。放在因子模型里,这就是多重共线性。变量很多,但都来自同一个因子,回归结果漂亮,参数却不稳定。AI 输出看起来有引用,底层没有足够独立样本。
实盘要考虑滑点
我做高频交易,最烦看起来对的信号。盘口买一很厚,你以为支撑强,实盘去吃,才发现那只是挂单,撤得比成交快。AI 推荐软件也有类似滑点:检索网页、排序来源、抽取片段、生成答案,每一步都会丢失真实信息,也会放大可操纵信号。你看到的推荐,离真实软件质量之间隔着好几层处理。
我不太相信这类榜单。引用机制奖励数量多、结构像、词面稳的内容时,制造页面天然有优势。行业目录、真实评测、论坛讨论也会被引用,但前提是能被机器方便抽取。内容竞争于是变成机械游戏:谁更像机器喜欢的样子,谁更容易被 AI 抬进答案。
我最近在企业邮和 QQ 邮箱上折腾过一阵,也写过单字母域名的 AI 邮箱。感觉类似:包装可以很快,信誉很难。真正的信誉需要时间、独立用户、稳定服务、投诉记录、更新日志,这些东西不适合被批量生产,也最容易被模板化内容绕过。
所以 Perplexity 引用这些页面,不代表它们真的代表最佳软件。它只能说明当前检索和排序逻辑下,这些页面获得了过高引用权重。对普通用户来说,这比幻觉更隐蔽。幻觉至少会自相矛盾,被污染的引用却看起来很整齐,甚至带着链接。
如果你要用 AI 选软件,别只看它给了什么答案,先看它给了谁。我的建议很简单:把引用来源复制出来,按域名、发布日期、内容结构、是否同一模板做去重。如果多个来源来自同一批页面,标题高度相似,只有关键词没有真实使用细节,就降低权重。采购或投资决策,至少再找三个不依赖同一 SEO 策略的信息源。AI 可以帮你缩小范围,但不能替你承担实盘滑点。
📌 本文编译自 Hacker News,原文:https://trellner.com/reports/manufactured-sources-behind-ai-recommendations/
版权归原作者所有,本文为基于公开报道的编译与独立分析。
物界前沿