Таблица из скана — в Excel: перестаньте перебивать руками
Прислали скан накладной или прайса, а данные нужны в Excel? Разбираем, как распознать таблицу из скана онлайн: сетку находит компьютерное зрение, текст читает OCR — и где у этого честные границы.
Прайс от поставщика приходит сканом. Накладная — фотографией из мессенджера. Старый отчёт существует только на бумаге. А данные нужны в Excel: отсортировать, посчитать, свести с другими таблицами. Стандартный путь — сесть и перебить всё руками — съедает час на каждую страницу и добавляет собственные опечатки поверх чужих. Эту работу давно пора отдать машине — с одной оговоркой: у распознавания есть границы, и о них стоит знать до загрузки файла, а не после.
Почему обычный OCR здесь не спасает
Обычное распознавание текста отвечает на вопрос «что здесь написано» и отдаёт поток строк. Для письма или статьи этого достаточно. Для таблицы — нет: важно не только что написано, но и в какой строке и колонке. Цена, оторвавшаяся от своего артикула, бесполезна — а склеивать поток строк обратно в таблицу вручную почти так же долго, как перебивать с нуля.
Поэтому распознавание таблиц — отдельный инструмент, а не режим обычного OCR: он восстанавливает структуру, а не только буквы.
Как инструмент видит таблицу
Работа идёт в два прохода. Сначала компьютерное зрение ищет сетку: находит горизонтальные и вертикальные линии, их пересечения — и так восстанавливает каркас таблицы, строки и столбцы. Затем в каждую найденную ячейку заходит Tesseract — движок распознавания текста. Он читает русский и английский, в том числе вперемешку: артикулы латиницей рядом с названиями кириллицей — обычное дело для прайсов и накладных.
Результат собирается в файл Excel с той же структурой: что было в третьей колонке пятой строки скана, то и окажется в ячейке C5.
От чего зависит качество
Помогает: ровный скан без перекоса, разрешение 200–300 DPI, контрастные линии сетки, печатный текст. Скан из офисного МФУ с настройками по умолчанию — идеальный кандидат.
Мешает: фотография под углом, тень от телефона, бледные линии, мелкий шрифт. Если исходник под рукой, пересканировать документ ровно — быстрее, чем вычищать результат кривого распознавания.
Хуже распознаётся: таблицы без рамок, где столбцы разделены только пустым местом. Компьютерному зрению не за что зацепиться, и соседние колонки могут склеиться. Попробовать стоит — но проверка результата в этом случае обязательна.
Не распознаётся: рукописный текст. Tesseract обучен на печатных шрифтах, и заполненный от руки бланк он не прочитает. Мы говорим об этом прямо, потому что отдать вместо цифр случайный набор символов — хуже, чем честно признать границу.
Проверяйте контрольные числа
OCR ошибается редко, но предсказуемо: путает похожие символы — ноль и букву О, единицу и семёрку, тройку и букву З. В накладной или счёте есть готовый способ самопроверки: итоговая сумма. Если «итого» в распознанном Excel сходится с суммой строк — почти наверняка всё в порядке. Не сходится — расхождение само укажет, в какой строке искать опечатку. Минута проверки против часа перебивания — всё ещё отличная сделка.
Пошагово: скан → Excel
Откройте инструмент
Распознавание таблиц — бесплатно, без регистрации и водяных знаков.
Загрузите скан
PDF со сканом или картинка JPG/PNG, до 20 МБ. Чем ровнее страница, тем чище результат.
Подождите
Поиск сетки и распознавание обычно занимают меньше минуты.
Скачайте Excel и сверьте
Проверьте итоговые суммы и подозрительные ячейки. Через час файлы автоматически удалятся с сервера.
Если PDF — не скан
Быстрая проверка перед загрузкой: откройте PDF и попробуйте выделить текст мышкой. Выделяется — значит, в файле есть текстовый слой, и распознавание не нужно вовсе: PDF в CSV вытащит таблицу напрямую — быстрее и без единой ошибки распознавания. OCR оставьте для случаев, когда текст «нарисован»: сканы, фотографии, PDF из старых архивов.
Частые вопросы
Рукописная таблица распознается?
Нет. Движок обучен на печатных шрифтах; рукописные записи он не прочитает, и обещать обратное было бы нечестно. Заполненные от руки бланки пока придётся перебивать по старинке.
Таблица без линий — совсем не получится?
Получиться может, но хуже: сетку инструмент ищет по линиям, а без рамок ему не за что зацепиться, и колонки иногда склеиваются. Загрузите и посмотрите на результат — но сверяйте его внимательнее обычного.
Какие языки поддерживаются?
Русский и английский, в том числе в одной таблице. Типичный прайс — русские наименования, латинские артикулы, цифры — распознаётся целиком.
Скан совсем плохого качества. Что можно сделать?
Лучший ход — пересканировать: 200–300 DPI, страница ровно на стекле, без теней. Если бумаги уже нет, попробуйте загрузить что есть — но отнеситесь к результату как к черновику и сверьте каждое важное число.
В накладной цены и реквизиты. Это безопасно?
Файл передаётся по HTTPS, распознаётся на сервере АльфаPDF и удаляется в течение часа вместе с результатом. Мы не читаем содержимое, не индексируем его и не обучаем на нём ИИ.
Коротко
Загрузите скан накладной, прайса или отчёта в распознавание таблиц — через минуту получите Excel с той же структурой строк и столбцов. Сверьте итоговые суммы — и данные готовы к работе. Бесплатно, без регистрации, файл удаляется через час.
Команда АльфаPDF — приватные онлайн-инструменты для PDF: сжатие, конвертация, OCR, подпись и защита. Файлы удаляются через 1 час. О нас →