Умный поиск документов: как находить информацию по смыслу, а не по названию файла
«Договор_финал_2_правки.docx» — типичное имя файла в любом архиве. Разбираем, почему поиск по названиям не работает, что даёт поиск по содержимому и где его границы.
«Договор_финал_2_правки_последний.docx» — имя файла, которое есть в каждом архиве. Через полгода никто не помнит, чей это договор, о чём и почему он финальный дважды.
Поиск по названиям на таких данных бессилен по построению: название не описывает содержимое. Разберём, что работает вместо и где у этого границы.
Почему поиск по названию не находит
Три причины, и все три встроены в то, как люди работают с файлами.
Имя пишет автор, а ищет другой человек. Автор знает контекст и называет «Смета Петров». Ищущий помнит только «та смета на кровлю в Химках».
Имя устаревает. Документ правился восемь раз, суть менялась, имя осталось от первой версии.
Имя не содержит ключевого. Сумма, срок, заказчик, предмет — всё это внутри, а снаружи только «Договор_2».
Поиск по полному тексту помогает, но частично: он находит совпадение слов. Если в документе написано «устройство кровельного покрытия», а вы ищете «крыша», он не найдёт.
Что делает поиск по смыслу
Тот же принцип, что и в поиске по товарам: сопоставление идёт не по написанию, а по содержанию.
Что это даёт практически:
- «договор на крышу в Химках» находит документ со словами «устройство кровли, г. Химки»;
- «где мы прописывали сроки поставки» находит нужный пункт, а не файл целиком;
- «что мы отвечали этому клиенту по гарантии» собирает несколько документов вокруг одной темы.
Ключевая разница с поиском по словам: вы ищете то, о чём документ, а не то, какими словами он написан.
Что нужно, чтобы это работало
Текст должен быть извлекаем. Главная практическая проблема архивов: сканы. PDF, который на самом деле фотография страницы, не содержит текста вовсе, и найти в нём нечего, пока не прогнан через распознавание.
Форматы должны читаться. Обычный набор — pdf, docx, xlsx, txt. Экзотика и старые форматы требуют отдельной возни.
Нужны права доступа. Поиск по общему архиву не должен показывать сотруднику то, чего ему не положено видеть. Это не техническая деталь, а требование, с которого стоит начинать.
Нужна ответственность за актуальность. Архив, где лежат три версии одного договора, будет находить все три. Поиск не решает, какая действующая, — это вопрос порядка в хранении.
Где поиск по смыслу ошибается
На числах и точных значениях. «Договор на 450 тысяч» — смысловой отбор тут слабее обычного точного поиска. Числа, даты, номера ищутся точным совпадением, и это нормально.
На именах собственных. Фамилия, название компании, адрес — то же самое: точное совпадение надёжнее.
На очень коротких документах. Из справки в три строки достать содержание почти нечего.
На однотипных документах. Тысяча одинаковых актов различается только реквизитами. Здесь поиск по смыслу найдёт «все акты», а нужен-то один.
Практический вывод: смысловой и точный поиск дополняют друг друга. Смысловой отвечает на «о чём», точный — на «где именно эти цифры». Система, где есть только один из двух, неудобна.
Практический пример: три запроса в архиве подрядчика
«что мы делали на объекте в Одинцово»
Смысловой поиск справляется: собирает договоры, сметы, акты, где упоминается объект, даже если в одних написано «г. Одинцово», а в других «Одинцовский р-н».
«договор, где была рассрочка на три платежа»
Тоже справляется: условие описано словами, и в разных договорах оно сформулировано по-разному.
«счёт на 128 400 рублей»
Здесь нужен точный поиск. Смысловой отбор по числу работает плохо, и притворяться иначе не стоит.
Отдельный случай: документ как запрос
Есть родственная задача, которую часто путают с архивным поиском, хотя она устроена иначе.
Клиент присылает не запрос, а файл: смету, спецификацию, техническое задание, список позиций. Нужно не найти документ, а разобрать его и подобрать по нему товары.
Это ровно та сторона, которой AISSE и занимается: умный поиск по документам, когда клиент прислал смету.
Разница принципиальная: в архивном поиске документ — это то, что ищут. Здесь документ — это то, чем ищут.
Чего ждать не стоит
Что поиск наведёт порядок в архиве. Он сделает беспорядок находимым, но не разберёт его. Дубли, устаревшие версии и файлы без владельца останутся.
Что он заменит структуру хранения. Папки и правила именования всё ещё нужны — хотя бы для того, чтобы понимать, какая версия действующая.
Что сканы заработают сами. Их надо распознать, и это отдельная работа с отдельным бюджетом.
Что можно обойтись без прав доступа. Наоборот: чем лучше поиск, тем заметнее любая дыра в правах.
Итог
Название файла не описывает его содержимое, поэтому поиск по названиям бесполезен в любом реальном архиве. Полнотекстовый поиск находит слова, смысловой — тему.
Работающая связка — оба сразу: смысловой для «о чём это было», точный для номеров, сумм и фамилий.
И отдельно стоит задача, которую легко перепутать с архивной: разобрать присланный клиентом документ и подобрать по нему товары. Там документ не результат поиска, а сам запрос.
Посмотреть, как документ работает запросом
Если к вам приходят сметы и спецификации от клиентов, эту часть можно проверить на своём каталоге. Демо AISSE собирает каталог по адресу сайта — дальше видно, как список позиций из документа превращается в подбор.