РуководстваКоманда АльфаPDF4 мин чтения

Таблица из скана — в Excel: перестаньте перебивать руками

Прислали скан накладной или прайса, а данные нужны в Excel? Разбираем, как распознать таблицу из скана онлайн: сетку находит компьютерное зрение, текст читает OCR — и где у этого честные границы.

Прайс от поставщика приходит сканом. Накладная — фотографией из мессенджера. Старый отчёт существует только на бумаге. А данные нужны в Excel: отсортировать, посчитать, свести с другими таблицами. Стандартный путь — сесть и перебить всё руками — съедает час на каждую страницу и добавляет собственные опечатки поверх чужих. Эту работу давно пора отдать машине — с одной оговоркой: у распознавания есть границы, и о них стоит знать до загрузки файла, а не после.

Почему обычный OCR здесь не спасает

Обычное распознавание текста отвечает на вопрос «что здесь написано» и отдаёт поток строк. Для письма или статьи этого достаточно. Для таблицы — нет: важно не только что написано, но и в какой строке и колонке. Цена, оторвавшаяся от своего артикула, бесполезна — а склеивать поток строк обратно в таблицу вручную почти так же долго, как перебивать с нуля.

Поэтому распознавание таблиц — отдельный инструмент, а не режим обычного OCR: он восстанавливает структуру, а не только буквы.

Как инструмент видит таблицу

Работа идёт в два прохода. Сначала компьютерное зрение ищет сетку: находит горизонтальные и вертикальные линии, их пересечения — и так восстанавливает каркас таблицы, строки и столбцы. Затем в каждую найденную ячейку заходит Tesseract — движок распознавания текста. Он читает русский и английский, в том числе вперемешку: артикулы латиницей рядом с названиями кириллицей — обычное дело для прайсов и накладных.

Результат собирается в файл Excel с той же структурой: что было в третьей колонке пятой строки скана, то и окажется в ячейке C5.

От чего зависит качество

Помогает: ровный скан без перекоса, разрешение 200–300 DPI, контрастные линии сетки, печатный текст. Скан из офисного МФУ с настройками по умолчанию — идеальный кандидат.

Мешает: фотография под углом, тень от телефона, бледные линии, мелкий шрифт. Если исходник под рукой, пересканировать документ ровно — быстрее, чем вычищать результат кривого распознавания.

Хуже распознаётся: таблицы без рамок, где столбцы разделены только пустым местом. Компьютерному зрению не за что зацепиться, и соседние колонки могут склеиться. Попробовать стоит — но проверка результата в этом случае обязательна.

Не распознаётся: рукописный текст. Tesseract обучен на печатных шрифтах, и заполненный от руки бланк он не прочитает. Мы говорим об этом прямо, потому что отдать вместо цифр случайный набор символов — хуже, чем честно признать границу.

Проверяйте контрольные числа

OCR ошибается редко, но предсказуемо: путает похожие символы — ноль и букву О, единицу и семёрку, тройку и букву З. В накладной или счёте есть готовый способ самопроверки: итоговая сумма. Если «итого» в распознанном Excel сходится с суммой строк — почти наверняка всё в порядке. Не сходится — расхождение само укажет, в какой строке искать опечатку. Минута проверки против часа перебивания — всё ещё отличная сделка.

Пошагово: скан → Excel

1

Откройте инструмент

Распознавание таблиц — бесплатно, без регистрации и водяных знаков.

Compressing…69%~2 seconds remaining
2

Загрузите скан

PDF со сканом или картинка JPG/PNG, до 20 МБ. Чем ровнее страница, тем чище результат.

Compressing…69%~2 seconds remaining
3

Подождите

Поиск сетки и распознавание обычно занимают меньше минуты.

Compressing…69%~2 seconds remaining
4

Скачайте Excel и сверьте

Проверьте итоговые суммы и подозрительные ячейки. Через час файлы автоматически удалятся с сервера.

Compressing…69%~2 seconds remaining

Если PDF — не скан

Быстрая проверка перед загрузкой: откройте PDF и попробуйте выделить текст мышкой. Выделяется — значит, в файле есть текстовый слой, и распознавание не нужно вовсе: PDF в CSV вытащит таблицу напрямую — быстрее и без единой ошибки распознавания. OCR оставьте для случаев, когда текст «нарисован»: сканы, фотографии, PDF из старых архивов.

Частые вопросы

Рукописная таблица распознается?

Нет. Движок обучен на печатных шрифтах; рукописные записи он не прочитает, и обещать обратное было бы нечестно. Заполненные от руки бланки пока придётся перебивать по старинке.

Таблица без линий — совсем не получится?

Получиться может, но хуже: сетку инструмент ищет по линиям, а без рамок ему не за что зацепиться, и колонки иногда склеиваются. Загрузите и посмотрите на результат — но сверяйте его внимательнее обычного.

Какие языки поддерживаются?

Русский и английский, в том числе в одной таблице. Типичный прайс — русские наименования, латинские артикулы, цифры — распознаётся целиком.

Скан совсем плохого качества. Что можно сделать?

Лучший ход — пересканировать: 200–300 DPI, страница ровно на стекле, без теней. Если бумаги уже нет, попробуйте загрузить что есть — но отнеситесь к результату как к черновику и сверьте каждое важное число.

В накладной цены и реквизиты. Это безопасно?

Файл передаётся по HTTPS, распознаётся на сервере АльфаPDF и удаляется в течение часа вместе с результатом. Мы не читаем содержимое, не индексируем его и не обучаем на нём ИИ.

Коротко

Загрузите скан накладной, прайса или отчёта в распознавание таблиц — через минуту получите Excel с той же структурой строк и столбцов. Сверьте итоговые суммы — и данные готовы к работе. Бесплатно, без регистрации, файл удаляется через час.

Команда АльфаPDF

Команда АльфаPDF — приватные онлайн-инструменты для PDF: сжатие, конвертация, OCR, подпись и защита. Файлы удаляются через 1 час. О нас →

Читайте также