Главная / OCR сканов

Распознавание сканов в браузере — без передачи на сервер

Tesseract.js работает локально, в памяти вашей вкладки. Сканированные PDF, фотографии договоров, акты от руки — всё распознаётся у вас. На сервер уходит только текст после вашей вычитки.

Почему важно, чтобы OCR был локальным

Когда юрист загружает скан договора в облачный OCR-сервис (Google Document AI, Yandex OCR, Adobe API) — изображение целиком уходит на чужой сервер, где его обрабатывают и могут хранить в кэше или логах. Для документов клиента это означает риск нарушения адвокатской тайны и 152-ФЗ.

В LexBridge OCR идёт прямо в браузере. Tesseract.js — open-source движок распознавания, скомпилированный в WebAssembly. Загруженный скан остаётся в памяти вкладки и никогда не покидает ваш компьютер. Результат — распознанный текст — вы видите и правите до того, как он уйдёт в ИИ.

Как работает

  1. Загрузка PDF — обычный input file. До 120 файлов одной операцией.
  2. Определение типа — если PDF текстовый (электронный), извлекается готовый текст; если скан (картинка) — запускается OCR.
  3. OCR в браузере — pdfjs рендерит каждую страницу в canvas, Tesseract.js распознаёт. Языковая модель русского языка загружается один раз, дальше работает оффлайн.
  4. Проверка распознанного текста — модалка «Проверьте распознавание». Юрист правит ошибки в номерах документов, суммах, фамилиях (типичные точки промаха OCR).
  5. Подтверждение — только после вашего «OK» текст уходит в ИИ-помощник или в авто-сборку иска.

Поддержка форматов и языков

  • Форматы: PDF (текстовый и сканированный), DOCX, DOC, RTF, TXT.
  • Языки OCR: русский (приоритет), английский. Смешанные документы распознаются корректно.
  • Качество: печатные документы — высокая точность. Рукописные записи и подписи — распознаются хуже (как и в любых OCR-движках).
  • Размер: до ~200 тыс. символов на документ. Длинные документы (договоры на 50+ страниц) усекаются с уведомлением, можно увеличить лимит вручную.

Что это даёт в связке с остальной СРМ

  • Загрузили папку сканов — ИИ-агент уже работает с распознанным текстом, собирает карточку дела.
  • В ИИ-помощнике можно задать вопрос «по этому документу» — ИИ читает распознанный текст.
  • В генерации иска — реквизиты сторон, номера договоров, даты подставляются из распознанных документов.
  • Документ хранится в S3 в зашифрованном виде, рядом — распознанный текст (тоже зашифрованный, ключ дела).