← К списку статей
Quando l'AI aziendale non sa quello che sa Глава 4 из 6
AI 2026-04-16 ProtoMedia

Унаследованная галлюцинация

Автоматический перевод с итальянского · смотреть оригинал

Глава 4 — Унаследованная галлюцинация

Это, пожалуй, самая поучительная история во всем расследовании, поскольку она затрагивает тему, которую игнорируют учебные пособия, но которая наносит больше вреда, чем все остальные вместе взятые: качество входящих данных.

Американская велосипедная компания — назовем ее так из уважения — располагала огромным фотоархивом, тысячами изображений продукции, мероприятий, клиентов на велосипедах, рекламных поездок. Это было визуальное наследие компании, накопленное за пятнадцать лет кампаний. В какой-то момент дальновидности кто-то использовал службу автоматической разметки, чтобы добавить к каждой фотографии список «присутствующих объектов»: «велосипед, шлем, дорога, гора, человек». Метаданные, полезные, в теории, для будущего визуального поиска. Они были сохранены рядом с фотографиями, забыты на годы, а затем извлечены и внедрены в новую корпоративную RAG с естественным убеждением, что «чем больше метаданных, тем лучше».

После обработки запросов, поиск по изображениям выдавал сюрреалистичные результаты. Вы искали "велосипеды в городе" и получали фотографию озера. Вы искали "модель в шлеме" и видели старинный автомобиль. Вы искали "гору" и получали что угодно — случайную выборку из всего архива, как будто система бросала жребий. Сначала команда указала пальцем на модель визуального внедрения. Затем на переранжировщик (см. предыдущую главу, чтобы понять, почему этот путь был особенно привлекательным). Затем на качество описаний, генерируемых ИИ.

Настоящее расследование, проведенное на этот раз с помощью прямого SQL-запроса к базе данных, показало нечто гротескное. Из 3997 фотографий каталога, все, абсолютно все, имели один и тот же список объектов. Список из девятнадцати элементов — "автомобиль, мотоцикл, озеро, море, гора, велосипед, шлем, дорога, город, человек..." — который не имел никакого отношения к содержанию отдельной фотографии. Он был импортирован много лет назад с другого веб-сайта в качестве набора общих тегов для заполнения обязательного поля CMS. Никто в компании больше этого не помнил. Фотографии переходили из системы в систему, унося с собой эти призрачные метки, достаточно правдоподобные, чтобы не вызывать подозрений, и достаточно ядовитые, чтобы испортить любой поиск, основанный на них. Поисковый движок, прилежно, использовал их как признак контента. И возвращал любую фотографию по любому запросу, с определенной степенью галлюцинации, гарантированной законом природы.

Самая болезненная истина, которую сложно принять, заключается в том, что в RAG "шумные" данные не создают слышимого шума. Они не замедляют систему, не вызывают ошибок и не зажигают индикаторы. Они просто тихо подтачивают качество результатов. И когда языковая модель получает пять документов, четыре из которых не по теме, она не говорит "они не относятся к делу, спроси что-нибудь другое": она усердно строит ответ, смешивая их, и этот ответ всегда звучит правдоподобно. Всегда. Итоговая — эта самая — галлюцинация — этот выдуманный ответ, на который мы жалуемся — рождается не из модели, как это принято считать. Она рождается выше, из данных. Модель всего лишь упаковывает ее в грамматически безупречное предложение. Но вина лежит в другом месте, глубже, в том, чем вы кормили систему за месяцы до того, как задали ей вопрос.

Это наблюдение имеет практические последствия, которые обходятся в деньги. Первая задача тех, кто создает серьезный корпоративный RAG, до написания первой строки кода, — провести вскрытие своих данных. Откуда они берутся. Кто к ним прикасался. Какие поля отслеживаются, а какие являются окаменелостями из предыдущих систем. Какие метаданные имеют значение сегодня, а какие имели в 2017 году, и никто больше не удосужился их очистить. Это не самая гламурная работа, очень архивная, полностью отсутствует в учебных пособиях, часто воспринимается как "нетехническая" и поэтому игнорируется командами разработчиков. Но без этой первоначальной гигиены любая гениальная архитектура, которую вы построите, просто станет очень мощным усилителем очень старого мусора.

В случае с американской компанией решение было жестоким, но правильным: очистить поле "объекты", восстановить метаданные с нуля, используя современную модель машинного зрения, примененную к каждой отдельной фотографии, и отслеживать, на этот раз, когда и как были созданы метаданные. Скучная работа. Результат: поиск наконец-то начал работать. Не потому, что они сменили модель. Потому что они убрались в кладовке.

Краткий урок: Прежде чем писать первую строку кода, проведите вскрытие своих данных. Без этой первоначальной гигиены любая архитектура становится усилителем мусора.

Есть замечание? Напишите нам

Сообщение предназначено только для нас. Если ваш комментарий будет интересен, мы можем опубликовать его в конце статьи, но только после проверки.

Пока вы пишете, ваш браузер решает небольшую вычислительную задачу — это наш способ защиты от автоматической рассылки без использования сторонних сервисов и запроса на распознавание изображений. Ничего не требуется, и данные не покидают этот сайт.