审计发现,Reddit AI 搜索会选择原本就热门的评论

审计发现,Reddit AI 搜索会选择原本就热门的评论

Reddit 的 AI 搜索在挑选评论时,偏向站内已经高赞、语气正式的那一批。伊利诺伊大学厄巴纳-香槟分校的研究者做了一次大规模审计:1 万个问题各跑 3 次,得到 3 万条 AI 回答,再回溯比对 1468 万条评论。问题取自 20 个建议和互助类子版,结论也只覆盖这类社区;论文目前是预印本。

数据里权重最大的变量是评论在帖内的投票排名。排名高 1 个标准差,被 AI 选中的几率乘以 2.88;被选中评论的得分中位数落在帖内第 91 百分位,没被选中的只在第 45 百分位。时间也占便宜,被选评论的中位发布时间是发帖后 1.2 小时,落选的是 5.9 小时;92% 的被选评论是对主帖的直接回复。写得长、带外链的评论同样占优,几率比分别是 1.79 和 2.25。得分为零或负分的评论占全部评论 5.1%,在被选评论里只剩 0.53%。

语言风格在热度之外另算一笔账。用文本分类器打分的正式程度是最强的语言预测因子,正式度每高 1 个标准差,选中几率高 49%;带 should、must 这类断言措辞的评论也略占优。反过来,第一人称、过去时这些个人经历标记多的评论,几率比只有 0.789,支持安慰型语言同样偏低。控制评论得分、楼层位置和发布时间之后,这组关联缩小但没有消失。研究者特意声明这是观察性研究,不能当因果结论用,也就是说照着写正式文体并不保证被选中。

对 1000 条查询的对照统计显示,I、my 这类第一人称词在被引用的原评论中占 3.3%,到 AI 生成的回答中降至 0.06%。作者认为,系统把个人证言改写成了泛化建议。同一批查询通过 OpenAI API 运行 GPT-4o-mini 和 GPT-5 并开启网络搜索时,两个模型合计 4932 条引用中只有 18 条指向 Reddit。报道提醒,该 API 环境与 ChatGPT 应用内的表现不能直接比较。

方法上,研究者用大模型把真实帖子改写成短查询,覆盖 r/personalfinance、r/AskDocs 等 10 个大版和 r/UKJobs、r/AusLegal 等 10 个小版;三次运行间隔约 5 小时,检索到相同帖子时回答几乎一致,说明差异主要来自检索了哪些帖。一条典型回答会用到约 7 个子版。这个功能 2024 年 12 月以 Reddit Answers 之名上线,2026 年 5 月 26 日并入站内统一搜索;测试查询取材的帖子截至 2026 年 7 月,审计发生在合并之后。Reddit CEO Steve Huffman 今年 2 月对投资者的说法是,Reddit 最擅长回答需要很多人不同视角的问题,这次审计量出来的,恰是哪些视角真的进了 AI 的答案。

如果这一模式成立,Reddit AI 回答更可能采用帖内排名较高、语气正式的评论,并在改写时删除大部分第一人称表达。作者提醒,这些结果未必适用于其他社区或 AI 搜索系统。由于论文尚未经过同行评审、目前也缺少第二个独立来源,该结论仍待核验,不能视为 AI 搜索的普遍规律。

相关文章

WhatsApp审计发现,Reddit AI 搜索会选择原本就热门的评论 – Geolix.ai | 让每一个品牌都能被 AI 看见