ГлавнаяИнструментыТекст и редактураРаспознать текст с картинки

Распознать текст с картинки

Перетащите фотографию, скриншот, скан или PDF — и получите текст, который можно выделить и скопировать. Работает по-русски и по-английски, разбирает многостраничные документы. Распознавание идёт прямо во вкладке, файлы на сервер не уходят.

Движок распознавания и словарь загрузятся при первом файле: около 13 МБ на русский язык. Дальше они берутся из кеша браузера.

Распознаваемая страница

0знаков
0слов
0строк
уверенность

Что влияет на качество распознавания

Порядок в таблице — по силе влияния. Первые две строки решают больше, чем всё остальное вместе.

ФакторКак надоЧто будет иначе

Сколько весит и сколько занимает

Всё, что загружается при первом запуске, лежит на этом сайте и кешируется браузером. Время распознавания — для страницы A4 на обычном ноутбуке.

ЧтоРазмерКогда загружаетсяВремя на страницу

Что распознаётся и с какой точностью

Инструмент вытаскивает текст из картинки: фотографии страницы, скриншота, скана, страницы PDF. На выходе получается обычный текст, который можно выделить, поправить и вставить куда угодно. Работает по-русски и по-английски, а при необходимости и с обоими языками сразу — это нужно документам, где рядом с русским текстом стоят латинские названия и обозначения.

Считает всё браузер. Движок Tesseract, собранный в WebAssembly, и языковая модель загружаются при первом файле и дальше берутся из кеша. Многостраничный PDF разбирается постранично: каждая страница рисуется на холст в двойном разрешении и распознаётся как картинка — так работают сканы, где текста внутри файла нет вовсе. Рядом с результатом показана средняя уверенность: ниже семидесяти процентов текст стоит перечитать глазами, потому что движок мог принять одну букву за другую.

Планшетный сканер
Скан в 300 точек на дюйм распознаётся заметно лучше любой фотографии. Фото: Santeri Viinamäki, CC BY-SA 4.0.
ИсточникЧто получитсяНа что смотреть
Скан документаПочти без ошибокРазрешение от 300 точек на дюйм.
СкриншотПрактически точноНе масштабируйте картинку перед распознаванием.
Фото страницыХорошо при ровном светеСнимайте сверху, без наклона и бликов.
Фото вывескиКак повезётДекоративный шрифт движок часто не берёт.
Рукописный текстНе распознаётсяНужны совсем другие модели.
Текстовый PDFЛучше извлечь напрямуюБыстрее и точнее без распознавания.

История: от оптофона до нейросети

Первые читающие машины появились задолго до компьютеров. В 1913 году Эдмунд Фурнье д’Альб построил оптофон — прибор, превращавший буквы в звуки, чтобы незрячий человек мог читать обычную книгу на слух. Читали такие устройства медленно, по несколько слов в минуту, зато принцип был тот же, что сегодня: свет, отражённый от страницы, превращается в сигнал.

Настоящее распознавание началось с 1974 года, когда Рэй Курцвейл собрал систему, читавшую текст любым шрифтом вслух. Первым покупателем стал музыкант Стиви Уандер. Дальше техника ушла в почту и банки: индексы на конвертах и суммы на чеках машины читали задолго до того, как это стало доступно дома.

Сам движок Tesseract начался в 1985 году в лаборатории Hewlett-Packard, был заброшен в середине девяностых, а в 2005 году открыт под свободной лицензией. С 2006 года его развивает Google, и в четвёртой версии распознавание перевели на нейросеть с длинной краткосрочной памятью: сеть читает строку целиком вместо разбора по одной букве, и от этого сильно выигрывает на связном тексте.

Машинописный текст
Ровный печатный текст — та задача, под которую движок и создавался. Фото: Викисклад, общественное достояние.
Ручная сортировка почты
Почта: машины научились читать индексы раньше, чем обычные документы. Фото: Викисклад, общественное достояние.

Как снимать и настраивать, чтобы вышло чисто

Главное решается до распознавания, при съёмке. Держите камеру строго над страницей, чтобы строки шли горизонтально: наклон в несколько градусов движок ещё выправляет, а перспективу от съёмки под углом уже теряет. Ищите ровный рассеянный свет: блик от лампы выедает часть строки насовсем. Кадрируйте по границам текста, иначе узор скатерти тоже пойдёт в разбор.

Язык выбирайте строго по тексту: два языка сразу означают две модели, вдвое больше загрузки и заметно более медленную работу. Колонки распознавайте по одной, вырезав нужную часть заранее. Кнопка «Склеить переносы» убирает разрывы строк внутри абзацев и сращивает слова, разорванные дефисом. Если PDF собран из текста и сканов внутри нет, быстрее и точнее сработает PDF в текст.

Языкирусский, английский
ДвижокTesseract 5, WebAssembly
Вес модели русского8,6 МБ
Вес движка4,7 МБ
Страница A43–7 секунд
Минимальная высота буквы20 пикселей
Рекомендуемый скан300 точек на дюйм
Рукописный текстне распознаётся
Файл на серверне отправляется

Как пользоваться

  1. Фотографию, скриншот, скан или PDF; можно перетащить или вставить из буфера обмена.
  2. Русский, английский или оба сразу — от этого зависит, какой словарь загрузится.
  3. Первый запуск дольше: загружается движок и языковая модель, дальше они берутся из кеша.
  4. Скопируйте в буфер или сохраните файлом .txt.

Частые вопросы

Насколько точно распознаётся текст

Ровный печатный текст со скана или чёткого снимка читается почти без ошибок. Фотография страницы под углом, с бликом или тенью даёт заметно хуже: движок рассчитан на прямые строки. Рукописный текст не распознаётся вообще — под него нужны совсем другие модели. Рядом с результатом показана средняя уверенность распознавания: ниже 70 процентов текст стоит перечитать глазами.

Что сделать, чтобы вышло лучше

Снимайте страницу сверху, без наклона, при ровном свете и без теней от собственной руки. Кадрируйте по границам текста: поля и посторонние предметы движок тоже пытается читать. Разрешение важнее мегапикселей камеры — буква должна быть высотой хотя бы 20 пикселей. Скан в 300 точек на дюйм почти всегда лучше любой фотографии.

Почему первый запуск такой долгий

Потому что в браузер загружается сам движок Tesseract, собранный в WebAssembly, и языковая модель: около 4,7 МБ движка и 8,6 МБ на русский язык. Всё это лежит на нашем сервере и кешируется браузером, поэтому второй и следующие разы начинаются сразу. Выбор сразу двух языков означает две модели и заметно более медленное распознавание.

Зачем выбирать язык

Движок сверяет формы букв со словарём и статистикой языка. Русский текст с английской моделью превращается в набор латиницы, потому что кириллических букв в ней просто нет. Два языка сразу нужны для документов со смешанным текстом — договоров с названиями компаний, технических инструкций, — но за это платится скоростью и небольшой потерей точности.

Файлы точно не уходят на сервер

Точно. Картинка читается из выбранного файла в память вкладки и распознаётся там же. С сервера приходят только движок и языковой файл. Ни изображение, ни распознанный текст никуда не отправляются и нигде не сохраняются.

Как обрабатывается PDF

Каждая страница рисуется на холст в двойном разрешении и распознаётся как картинка. Это нужно для сканов, где текста как такового нет — есть фотография страницы. Если PDF собран из текста, быстрее и точнее будет обычное извлечение: для этого есть отдельная страница PDF в текст.

Что происходит с разметкой

Она теряется. На выходе получается простой текст с разбивкой на строки и абзацы: таблицы превращаются в строки со значениями, колонки могут перемешаться, жирное и курсивное начертание не сохраняется. Колонки лучше распознавать по одной, вырезав нужную часть страницы заранее.

Сколько страниц потянет вкладка

Страница А4 распознаётся за несколько секунд на обычном ноутбуке, поэтому документ на два-три десятка страниц — это минуты работы. Сотню страниц лучше разбить на части: всё время работы вкладка занята, и закрывать её нельзя.

Ещё инструменты для текста

Проверка орфографии, анализ на воду и тошноту, счётчик символов, сравнение двух текстов, типографор, регистр и замены — в разделе 37 инструментов.