Юрист получил в канцелярии суда пачку сканов — исковое заявление на 40 страниц, куча приложений. Дальше по классике: либо руками перепечатывать реквизиты в свою систему, либо ставить «ABBYY Finereader» на машину, либо загружать в онлайн-OCR (и тут же задумываться — а куда же уходит этот скан). В LexBridge распознавание встроено в процесс работы с делом. И оно устроено принципиально по-другому.
Zero-knowledge OCR: скан не покидает вашу вкладку
Когда юрист прикрепляет PDF к делу или к мастеру иска, наш сервер сначала пытается вытащить текстовый слой стандартным способом: pdf-parse, для DOCX — mammoth, для ODT — распаковка ZIP-контейнера. Если файл содержит нормальный текстовый слой (98% современных PDF) — сервер отдаёт текст, ИИ дальше работает уже с ним.
Если же в файле меньше сотни символов — это скан-картинка. И тут срабатывает наша ключевая штука: OCR запускается прямо в браузере юриста. Открывается PDF через pdfjs, каждая страница растеризуется в canvas с разрешением ~160 dpi, распознаётся движком Tesseract.js (WASM) с русской моделью. Всё это происходит на машине юриста. Байты скана на наш сервер не уходят.
Мы не шлём ваш скан в Yandex.Cloud OCR или Google Vision. Мы вообще не шлём его. Скан существует только в оперативной памяти вашей вкладки. В S3 попадает только зашифрованный на ключе дела текстовый результат — уже после того, как юрист его сверил.
Это принципиальная разница с любым облачным OCR. У Yandex.Cloud OCR — свои политики хранения, у Google Vision — свои. Для юриста, у которого в скане может быть паспорт клиента, банковская выписка или медицинская экспертиза, это не теоретический вопрос. Адвокатская тайна ст. 8 закона об адвокатуре — вполне буквальная.
Одиннадцать форматов, единая точка загрузки
После недавнего обновления мы принимаем везде одинаково: PDF (и текстовый, и сканированный), DOCX, DOTX (шаблон Word), DOC/DOT (старый бинарный формат — best effort), ODT/ODS/ODP (LibreOffice/OpenOffice), их плоские варианты FODT/FODS/FODP, RTF, TXT и Markdown. Языки OCR — русский приоритетно, английский дополнительно; смешанные документы (например, контракт с приложением на двух языках) читаются корректно.
Важное отличие от конкурентов — единая точка загрузки для шести сценариев. Мастер нового иска, карточка дела, чат с ИИ, реанализ, привязка текстов к issue, добавление документа в реестр — везде работает один и тот же движок. Не бывает такого, что в одном модуле распознаётся, а в другом «этот тип файла не поддерживается».
Обязательный шаг сверки: почему Tesseract — не волшебная палочка
Мы не прячем от юриста тот факт, что OCR ошибается. После распознавания скана открывается окно «OCR · сверьте реквизиты»: слева — исходное изображение страницы, справа — распознанный текст в редактируемом поле. Юрист пробегает глазами номер договора, суммы, даты, фамилии — правит там, где движок ошибся (типично — цифра «0» распознана как буква «О», штамп с печатью читается как каша).
Только после нажатия «Подтвердить» распознанный текст уходит в ИИ-анализ. Мы принципиально не позволяем модели читать документ «слепо» — юрист несёт ответственность за правильность цифр, и вся эта ответственность — в том числе за момент сверки, а не «я же загрузил, дальше сами разбирайтесь».
Пять сценариев из практики
1. Скан иска противника из канцелярии. Юрист забрал в суде копию искового — сорок страниц, приложения на пятидесяти. Загружает в LexBridge как документ дела. OCR распознаёт за 2–3 минуты, юрист сверяет реквизиты сторон и сумму. Дальше жмёт «Проанализировать иск» — ИИ разбирает требования, находит слабые места позиции истца, предлагает возражения с цитатами практики. От скана до черновика отзыва — десять минут.
2. Фото на телефон в коридоре суда. Юрист сделал фото документа с телефона (пока PDF, для JPG/PNG в мастере иска мы доделываем прямую загрузку). Тот же пайплайн: OCR в браузере, сверка, анализ. Не нужно возвращаться в офис, чтобы отсканировать.
3. Старые бумажные договоры 2005–2015 годов. Клиент принёс папку договоров без текстового слоя, все — отсканированные из бумаги. Мастер «Новый иск» гоняет OCR пофайлово с видимым прогрессом (сколько страниц осталось), юрист правит сомнительные места и получает готовую карточку дела: стороны, суммы, даты подтянуты автоматически из распознанной первички.
4. Пакет накладных и претензий по поставочному спору. Обычная ситуация: 30–50 накладных за период. Загружаются пачкой, каждая проходит OCR, ИИ агрегирует суммы, сверяет с условиями договора, находит расхождения. Юрист получает не «прочитанные документы», а уже сравнённую таблицу «по договору vs фактически поставлено».
5. Приказы и постановления с гербовой печатью. Здесь у Tesseract традиционно две проблемы: печать (пиксельная каша) и узкий шрифт официальной шапки. Мы это знаем — в окне сверки зона штампа помечается: «низкая уверенность распознавания, сверьте вручную». Тело документа читается хорошо, реквизиты юрист правит там, где нужно.
Почему это не тарифицируется
Распознавание — нагрузка на машине юриста, не на наших серверах. У нас нет ни роста стоимости с объёмом (сто страниц или тысяча — наш кошелёк не трогает), ни политики «первые 10 страниц бесплатно, дальше по 3 рубля». OCR включён в тариф. Платите только за ИИ-запросы, которые запускаете уже после распознавания.
Единственный побочный эффект — браузер немного нагревается. Ноутбук пятилетней давности справляется, но скан на двести страниц займёт минут пять–шесть. На новом железе — секунды.
Что это меняет
У юриста в реальной работе не бывает документов «в виде текста». Бывают сканы. Бывают фото. Бывают старые PDF, склеенные из графики. И в 90% случаев процесс «загрузить документ в ИИ» спотыкается ровно на этом шаге: либо «не поддерживается», либо «отправить в наш облачный OCR» (то есть в чей-то ещё сервер).
Мы пытались убрать оба препятствия сразу. Пайплайн, который принимает всё, и принципиальная приватность распознавания. Это скучный кусок инфраструктуры, но именно он решает, будете вы работать в системе или каждый раз перепечатывать реквизиты руками.