继承的幻觉
机器自动翻译自意大利语 · 查看原文
第四章 — 继承的幻觉
这也许是整个调查中最具启发性的故事,因为它触及了一个主题,即教程会忽略的主题,而这个主题却比其他所有主题加起来造成的损害更大:进入数据的质量。
一家美国的自行车公司——为了表示尊重,我们这样称呼它——拥有一个巨大的照片档案,数千张产品、活动、骑自行车者和促销旅行的照片。这是公司十五年来积累的视觉资产。在某个有远见的时候,有人使用自动标记服务,为每张照片添加一份“存在对象”列表:“自行车、头盔、道路、山脉、人”。从理论上讲,这些元数据对于未来的视觉搜索是有用的。它们与照片一起存档,被遗忘多年,然后被检索并导入到新的公司RAG中,自然地认为“更多的元数据更好”。
摄入后,图像搜索的结果变得超现实。你搜索“城市自行车”,却出现湖的照片。你搜索“戴头盔的女性模特”,却出现一辆老爷车。你搜索“山”,无论什么都会出现——整个档案的随机样本,仿佛系统在抽签决定。团队最初将矛头指向视觉嵌入模型。然后指向重新排序器(参见前一章,以了解为什么这条线索特别诱人)。然后指向人工智能生成的描述的质量。
真正的调查,这次是通过直接向数据库发送 SQL query,揭示了一件怪诞的事情。在 3997 张目录照片中,所有照片,确切地说所有照片,都具有相同的对象列表。一个包含十九个元素的列表——“汽车、摩托车、湖泊、大海、山脉、自行车、头盔、道路、城市、人...”——与每张照片的内容没有任何关系。它是在几年前从另一个网站导入的,作为填充 CMS 强制字段的通用标签集。公司里没有人再记得这件事了。这些照片在系统之间流转,带着这些幽灵般的标签,这些标签看似合理,不会引起怀疑,但足以破坏基于这些标签的任何搜索。搜索引擎兢兢业业地将它们用作内容迹象。并且会针对任何查询返回任何照片,并且根据自然法则保证一定程度的幻觉。
最令人难受、真正让人意识到问题的关键在于,在 RAG 系统中,“噪声”数据并不会发出可听见的噪音。它们不会降低系统速度,不会产生错误,也不会触发警报。它们只是会悄无声息地侵蚀结果的质量。当下游语言模型收到五份文档,其中四份与主题无关时,它不会告诉你 “这些不相关,问我其他问题”:而是会认真地构建一个将它们混合在一起的答案,而且这个答案听起来总是合理的。总是如此。最终的“幻觉”——我们抱怨的那个编造的答案——并非来自模型,正如主流叙述所说的那样。它诞生 在上游,来自数据。模型只是将其包装成一句语法完美无缺的句子。但责任在于别处,更早之前,在于你几个月前提供给系统的那些数据。
这项观察具有实际意义,会带来经济损失。构建一个严肃的企业级RAG的首要任务,在编写任何代码之前,是对自身数据进行剖析。数据来自何处。谁接触过这些数据。哪些字段被观察到,哪些是旧系统的遗留物。哪些元数据今天有意义,哪些在2017年有意义但从未被清理过。这是一项不那么引人注目的工作,更偏向于档案管理,完全没有出现在教程中,通常被开发团队视为“非技术性”工作而忽略。但如果没有这种初始的清理,无论你构建多么精妙的架构,它都只会成为一个放大旧垃圾的强大工具。
对于这家美国公司来说,解决方案是残酷而正确的:清空“对象”字段,从零开始使用现代视觉模型重建元数据,并记录每次元数据的生成时间和方式。这是一项枯燥的工作。结果是:搜索终于开始正常工作。不是因为他们改变了模型。而是因为他们清理了地下室。
有评论吗?请写下
此消息仅发送给您。 如果您的评论有趣,我们可能会在文章末尾发布它,但仅在经过审核后。
您在输入时,浏览器正在解决一个简单的计算问题:这是我们防止自动垃圾邮件的方式,无需使用第三方服务或要求您识别图像验证码。无需任何操作,您的数据不会离开本网站。