Ученые ЮФУ разработали гибридный метод поиска для логистических систем

Ученые Южного федерального университета (ЮФУ) предложили метод, который позволяет обрабатывать логистические запросы на естественном языке в десятки раз быстрее графового поиска и при этом дает ответы точнее, чем при векторном поиске. В центре разработки — архитектура RAG (Retrieval-Augmented Generation), при которой языковая модель не генерирует ответ «из головы», а сначала находит релевантные фрагменты во внешней базе знаний.

Логистические компании ежедневно обрабатывают огромные объемы данных: транспортные накладные, складские отчеты, сводки о пробках, погоде и авариях. Оператору, чтобы ответить на простой вопрос, когда приедет груз, приходится просматривать несколько разрозненных источников, а искусственный интеллект, отвечая на подобные вопросы, нередко выдает некорректный ответ.

«Главная проблема связана с тем, что логистические системы работают с большим количеством разнородных и быстро обновляющихся данных. Пользователю часто нужен не просто поиск по ключевым словам, а ответ с учетом связей между объектами. Обычные поисковые алгоритмы плохо справляются с такими запросами, потому что они не всегда учитывают структуру логистической сети», — рассказал один из авторов исследования, магистрант Института компьютерных технологий и информационной безопасности ЮФУ Вадим Волощук.

Предложенный алгоритм работает так: если пользователь называет конкретный объект, программа мгновенно выдает всю связанную с ним информацию. Если же запрос сформулирован в свободной форме, компьютер находит несколько самых близких по смыслу «точек-семян», от каждой из них запускает обход графа на заданную глубину, собирает все связанные объекты и ранжирует их по комбинированному правилу.

«Векторное представление помогает находить объекты, близкие к запросу по смыслу, даже если пользователь формулирует вопрос иначе, чем это записано в базе данных. Графовая часть сохраняет связи между объектами: складами, магазинами, дорогами, транспортом, погодными условиями и другими элементами логистики. Их объединение позволяет сначала найти близкие по смыслу объекты, а затем уточнить результат с учетом реальных зависимостей в системе. Риск «галлюцинаций» снижается за счет того, что языковая модель получает не большой набор разрозненных текстов, а компактный и связанный», — добавил еще один автор работы, магистрант ЮФУ Ярослав Мельник.

Разработчики испытали метод на синтетических данных, моделирующих логистические сети разного масштаба — от относительно небольших (порядка пятисот ключевых объектов и десятков тысяч связей) до крупных (свыше двух тысяч объектов и сотен тысяч связей). Сравнивали три подхода: чистый графовый поиск, чистый векторный поиск и гибридный. Точность оценивали по доле правильных ответов среди трех лучших результатов. Гибридный поиск показал результаты в два раза лучше, чем графовый, и в полтора раза лучше, чем векторный.

«Параметры вклада семантической близости к запросу и вклада близости в графе являются самыми значимыми. Также существуют вспомогательные параметры, которые помогают учитывать локальную и общую значимость узла в сети. Метод чувствителен к этим настройкам, но не критически: их нужно подбирать под тип задачи. Для более текстовых запросов важнее семантика, для маршрутов и зависимостей — графовая часть», — объяснил Вадим Волощук.

По мнению авторов исследования, полученные результаты имеют очевидную практическую ценность. Например, оператор может спросить у системы: «На каких доставках на прошлой неделе были задержки из-за погоды?» — и получить точный ответ, не тратя часы на ручной разбор отчетов. А диспетчер, увидев сообщение об аварии на трассе, мгновенно узнает, какие рейсы и в какие магазины попадают под удар. Система может сама предупредить: «Поставка молочной продукции в магазин 12 будет задержана из-за дождя на участке М-4».

Разработчики отмечают, что для практического внедрения модель нужно адаптировать под конкретную систему, настроить параметры поиска и провести оценку качества ответов вместе со специалистами предметной области. На первом этапе метод разумно рассматривать не как замену существующих систем, а как дополнительный модуль для более удобного доступа к связанным данным.