Практика ИИ
OCR для отдела продаж: как проверить артикул и цену в скане заявки
Распознанный документ может читаться гладко и содержать неверную цифру в артикуле. При переносе заявки в CRM важнее сохранить коммерчески значимые поля, чем получить красивый сплошной текст.
Обновлённый разбор связывает исследование исторических книг с отдельной проектной задачей: проверкой сканов заказов. Результаты книжного теста не переносятся на счета и спецификации автоматически.
Коротко
- Оценивайте точность нужных полей отдельно от средней точности символов.
- Показывайте менеджеру исходный участок страницы.
- Не угадывайте цену или количество по соседним позициям.

Что проверял FineBooks
По обзору The Decoder, FineBooks от Hugging Face и EleutherAI сравнивал 14 OCR-моделей на 2 165 страницах исторических книг. Лучшие результаты превышали 97% точности символов. Это не доля безошибочных страниц, строк заказа или коммерческих полей.
В обзоре различаются режимы оценки символов, но условия расчёта стоимости и режим конкретной строки рейтинга здесь не установлены. Точные значения из таблицы не используем как ориентир качества или бюджета внедрения; стоимость обработки своих документов предстоит измерить отдельно.
Существенны ограничения выборки: одноколоночные страницы, шрифты Antiqua, английский, французский, немецкий и латинский языки. Рукопись, нелатинские письменности и Fraktur в эту оценку не входят. Эти условия не соответствуют автоматически русскоязычной таблице заказа.
В статье также различаются режимы оценки, которые считают модернизацию исторического символа ошибкой либо допускают её. Для библиотеки важны координаты слов в ALTO XML, тогда как новые модели могут выдавать только Markdown или обычный текст.
Коммерческая ошибка весит иначе
В предлагаемом сценарии клиент присылает фотографию спецификации. Помощник извлекает артикул, наименование, количество и единицу измерения. Менеджер должен проверить каждую позицию до расчёта предложения. Смысловой пересказ документа для этой задачи недостаточен.
Ошибка в одном знаке артикула может указать на другую деталь. Пропущенная запятая меняет количество, а сдвиг строки связывает цену с соседним товаром. Поэтому общий показатель правильно распознанных символов дополняйте проверкой целых полей и соответствия строк.
- Сохраните исходный файл и номер страницы для каждой позиции.
- Покажите участок изображения рядом с распознанным значением, если выбранный инструмент позволяет надёжно получить координаты.
- Если координат нет, честно используйте ссылку на страницу вместо выдуманной точной подсветки.
- Пустое или сомнительное значение отправляйте на уточнение, не восстанавливая его по каталогу без проверки.
Подготовьте испытание на своих документах
Соберите разрешённые примеры с разными таблицами, качеством съёмки, печатями и переносами страниц. Добавьте документы, которые система должна отклонить. Эталонные значения сверяют сотрудники, знакомые с номенклатурой; случайную ошибку в эталоне нельзя считать недостатком OCR.
- Сравните распознавание целых артикулов и количеств с ручным вводом.
- Проверьте, не объединяются ли соседние строки и не теряются ли повторяющиеся позиции.
- Измерьте время проверки с открытием исходного скана, а не только время ответа модели.
- Зафиксируйте долю документов, требующих полного повторного ввода.
Отдельно испытайте противоречие между текстом и каталогом. Если распознанного артикула нет, помощник может предложить кандидатов, но не должен молча заменить его ближайшим. Решение сотрудника и исходное значение сохраняются в журнале.
Граница до коммерческого предложения
Перед передачей файлов внешнему сервису согласуйте состав данных и условия обработки. Для испытания часто достаточно обезличенных страниц, но удаление имени не гарантирует отсутствия коммерческой тайны: спецификация сама может раскрывать планы клиента.
Итог пилота должен назвать допустимые виды документов и поля, которые остаются ручными. Если выигрыш съедает проверка таблиц, ограничьте автоматизацию регистрацией файла и подготовкой черновика. Книжный рейтинг помогает выбрать кандидатов для теста, но не заменяет этот тест.
Источники и границы разбора
- Прочитанный материал The DecoderOld OCR text cripples language model training, and FineBooks wants to fix that at scale
Прочитаны доступный веб-текст и сохранённый полный обзор The Decoder. Проверены выборка, символьная метрика и ограничения. Первичный leaderboard не проверен; точные показатели и стоимость исключены из вывода.
Практический сценарий — редакционное предложение, не отчёт о внедрении. Дата первой публикации сохранена; содержание пересмотрено редакцией.
Обсудить границы задачи
Опишите форматы входящих спецификаций и поля, ошибка в которых меняет коммерческое предложение.
Связаться с ИИшниками