Распознавание текста со сканов и фотографий
Сканированный документ — это картинка с текстом, поэтому копирование, поиск и выделение по нему не работают. OCR читает символы обратно. Вы получаете либо готовый текст, либо тот же документ с невидимым текстовым слоем, после чего он ведёт себя как обычный PDF.
- Сканированные PDF и фотографии, до 200 страниц
- Семь языков, включая русский, японский и китайский
- Searchable PDF сохраняет вид страниц без изменений
- Файлы удаляются автоматически — 24 часа бесплатно, 7 дней на платных тарифах
PDF, PNG, JPG, TIFF, BMP, GIF, WebP или HEIC.
Выберите язык, который реально на странице. Неверный не даст ошибку — он вернёт бессмыслицу.
Как извлечь текст из скана
- 01
Загрузите скан или фото
Выберите сканированный PDF или изображение страницы. Многостраничные PDF читаются постранично, по порядку.
- 02
Укажите язык
Выберите язык, на котором действительно написан документ. Это важнее, чем кажется: неверный язык не выдаёт ошибку, он выдаёт уверенную бессмыслицу.
- 03
Выберите текст или searchable PDF
Обычный текст даёт символы для копирования. Searchable PDF возвращает исходные страницы со скрытым текстовым слоем: файл выглядит так же, но по нему работают поиск и выделение.
- 04
Заберите результат
Текст появляется на странице и готов к копированию; searchable PDF скачивается сразу.
Что влияет на точность
Разрешение. Страницы рендерятся в 300 DPI — это значение рекомендует документация самого Tesseract. У фотографии издалека или скана в 100 DPI движку просто меньше с чем работать.
Ровность и фокус. Страница, снятая под углом, или текст, уходящий в корешок книги, распознаются заметно хуже плоского скана.
Язык. У каждого языка своя обученная модель. Кириллица или японский, прогнанные через английскую модель, вернут гладкую чепуху, а не ошибку — поэтому список предлагает только языки, которые сервер действительно может загрузить.
Чего OCR не делает. Вёрстка не сохраняется: колонки, таблицы и колонтитулы возвращаются сплошным текстом в порядке чтения. Если у PDF уже есть текстовый слой, конвертация в текст использует именно его — точно, мгновенно и лучше любого OCR.
Для чего это используют
Договоры и счета
Подписанный PDF, пришедший сканом, превращается в файл с поиском — чтобы потом найти номер или сумму.
Чеки, снятые на телефон
Вытащить суммы и даты из фотографии вместо повторного набора руками.
Старые документы и архивы
Бумаги, отсканированные годы назад, становятся искомыми без изменения внешнего вида страниц.
Скриншоты и слайды
Вернуть текст из картинки, когда исходного файла давно нет.
Частые вопросы
Что такое searchable PDF?
PDF, который выглядит точно как загруженный скан, но содержит невидимый слой распознанного текста поверх слов. Визуально страницы не меняются, зато по ним работают выделение, копирование и поиск — в том числе в другом ПО.
Какие языки поддерживаются?
Английский, русский, французский, немецкий, испанский, японский и китайский упрощённый. Список показывает ровно то, что сервер способен загрузить, — язык, который дал бы бессмыслицу, не предлагается.
Сколько страниц можно обработать?
До 200 страниц на файл. Каждая страница рендерится и читается отдельно, поэтому длинный документ занимает пропорционально больше времени.
Насколько OCR точен?
На чистом ровном скане печатного текста — очень точен. Рукописный текст, фото низкого разрешения, страницы под углом и необычные шрифты распознаются заметно хуже. Важные цифры всегда проверяйте: ошибки OCR выглядят как правдоподобный текст, а не как ошибка.
Вы храните мой документ?
Не дольше срока хранения вашего тарифа: 24 часа на бесплатном и для посетителей без аккаунта, 7 дней на платных. Файл передаётся по TLS и не используется ни для чего, кроме получения вашего результата.
В моём PDF текст уже выделяется. Нужен ли OCR?
Нет. Если у PDF есть текстовый слой, конвертация в текст берёт именно его — точно и мгновенно. OCR включается только тогда, когда извлекать нечего, то есть страница действительно является картинкой.