Области Приглашения Уведомления

OCR-распознавание документов

Скан с печатью — это картинка, а не текст. Без OCR анализ не увидит ни штраф, ни срок. Распознавание вытаскивает строки из PDF-сканов и фото, сохраняет структуру страниц и отдаёт текст дальше в проверку договора.

PDF / JPG / PNGсканы и фото
Слой текстадо анализа ИИ
RU / ENделовые тексты

Быстрые инструменты

Проверка фрагмента текста в браузере — до 5 000 символов, без регистрации

Каталог (158) →

Цепочка: файл → текст → отчёт

  1. Загрузка. Скан PDF, JPG, PNG или смешанный пакет; текстовый DOCX OCR не требует.
  2. Предобработка. Выравнивание страницы, попытка починить ориентацию, очистка шума.
  3. Распознавание. Извлечение текста блоками: абзацы, заголовки, таблицы где удаётся.
  4. Передача в анализ. Тот же конвейер рисков и чек-листа, что у «родного» текста.
  5. Контроль сомнений. Фрагменты с низкой уверенностью стоит сверить глазами перед подписью.

Что распознаётся устойчиво, а что нет

ИсходникОжиданиеРиск ошибки
Скан ≥ 200 dpi, ровноВысокая читаемостьНизкий — мелкий кегль в сносках
Фото с телефонаРабочий текст при хорошем светеБлики, перспектива, обрезанные края
Таблицы спецификацийЧасто восстанавливаютсяСлипшиеся столбцы, рукописные правки
Печати / штампы поверх текстаТекст рядом часто читаетсяЦифры под печатью — проверять вручную
Рукописные пометкиБазовый захватНе считать юридически достоверным без сверки

Лимиты качества

Когда без OCR не обойтись

Включайте сценарий со сканами, если договор пришёл с ЭДО как image-PDF, скан с печати контрагента или архивная копия без текстового слоя. Нативный DOCX/текстовый PDF грузите как есть — лишний OCR только тратит время и квоту.

Чек-лист перед распознаванием

№Что проверитьГде / контекстКритерий «ОК»Типичная ошибка
1Читаемость глазамиПревью файлаСтроки различимы без угадыванияТёмный снимок вечерним светом
2Полнота страницКонец файлаЕсть последняя страница с реквизитамиОбрезали подпись при скане
3ОриентацияАльбомные приложенияСтраницы не «лёжа»Спецификация повёрнута на 90°
4Сверка суммПосле OCRЦифры цены совпадают с бумагойПоверили score без проверки цифр
5Критичные оговоркиОтветственность / срокЮрист глазами сверил 2–3 абзацаПодпись по одному отчёту OCR

Порядок использования

  1. Отсканируйте или сфотографируйте документ так, чтобы текст читался без зума «в упор».
  2. Загрузите файл; дождитесь статуса распознавания, затем анализа.
  3. Сверьте суммы, даты и реквизиты с бумагой или исходным сканом.
  4. Разберите риски в отчёте; сомнительные фрагменты OCR пометьте в комментарии команде.

Пример из практики

Договор с печати → замечания за день

Без OCR. Секретарь перепечатывала ключевые пункты вручную; в ответственность попала опечатка «0,1%» вместо «0,01%» в сутки — спор на миллионы.

С OCR. Скан ушёл в AIARM, юрист сверил цифры пени с бумагой (чек-лист выше), остальной текст разобрали по отчёту. Для архива из десятков сканов — пакет; выгрузка таблиц спецификаций — через экспорт.

Частые вопросы

Нужен ли OCR для обычного DOCX?

Нет. Текстовый слой уже есть. OCR нужен, когда файл — изображение или PDF без текста (часто так отдают подписанные сканы).

Почему анализ «не видит» пункт на странице 17?

Чаще всего страница криво отсканирована, перекрыта печатью или имеет слишком мелкий шрифт. Откройте превью распознанного текста по этой странице; при пустоте — пересканируйте лист и перезапустите только этот файл.

Можно ли доверять цифрам из таблицы спецификации?

Только после выборочной сверки с оригиналом. OCR путает похожие символы; для цены, объёма и НДС ручная проверка обязательна перед оплатой.

OCR работает в пакетной загрузке?

Да: сканы встают в ту же очередь, что и текстовые файлы, но дольше. Планируйте дедлайн с запасом на хвост OCR или сначала прогоните «чистые» PDF.

Прогоните один скан до отчёта

Загрузите подписанный image-PDF и сверьте суммы с бумагой — так команда поймёт, где OCR достаточно, а где нужна рука юриста.