Распознать текст с картинки
Перетащите фотографию, скриншот, скан или PDF — и получите текст, который можно выделить и скопировать. Работает по-русски и по-английски, разбирает многостраничные документы. Распознавание идёт прямо во вкладке, файлы на сервер не уходят.
Движок распознавания и словарь загрузятся при первом файле: около 13 МБ на русский язык. Дальше они берутся из кеша браузера.
Что влияет на качество распознавания
Порядок в таблице — по силе влияния. Первые две строки решают больше, чем всё остальное вместе.
| Фактор | Как надо | Что будет иначе |
|---|
Сколько весит и сколько занимает
Всё, что загружается при первом запуске, лежит на этом сайте и кешируется браузером. Время распознавания — для страницы A4 на обычном ноутбуке.
| Что | Размер | Когда загружается | Время на страницу |
|---|
Что распознаётся и с какой точностью
Инструмент вытаскивает текст из картинки: фотографии страницы, скриншота, скана, страницы PDF. На выходе получается обычный текст, который можно выделить, поправить и вставить куда угодно. Работает по-русски и по-английски, а при необходимости и с обоими языками сразу — это нужно документам, где рядом с русским текстом стоят латинские названия и обозначения.
Считает всё браузер. Движок Tesseract, собранный в WebAssembly, и языковая модель загружаются при первом файле и дальше берутся из кеша. Многостраничный PDF разбирается постранично: каждая страница рисуется на холст в двойном разрешении и распознаётся как картинка — так работают сканы, где текста внутри файла нет вовсе. Рядом с результатом показана средняя уверенность: ниже семидесяти процентов текст стоит перечитать глазами, потому что движок мог принять одну букву за другую.

| Источник | Что получится | На что смотреть |
|---|---|---|
| Скан документа | Почти без ошибок | Разрешение от 300 точек на дюйм. |
| Скриншот | Практически точно | Не масштабируйте картинку перед распознаванием. |
| Фото страницы | Хорошо при ровном свете | Снимайте сверху, без наклона и бликов. |
| Фото вывески | Как повезёт | Декоративный шрифт движок часто не берёт. |
| Рукописный текст | Не распознаётся | Нужны совсем другие модели. |
| Текстовый PDF | Лучше извлечь напрямую | Быстрее и точнее без распознавания. |
История: от оптофона до нейросети
Первые читающие машины появились задолго до компьютеров. В 1913 году Эдмунд Фурнье д’Альб построил оптофон — прибор, превращавший буквы в звуки, чтобы незрячий человек мог читать обычную книгу на слух. Читали такие устройства медленно, по несколько слов в минуту, зато принцип был тот же, что сегодня: свет, отражённый от страницы, превращается в сигнал.
Настоящее распознавание началось с 1974 года, когда Рэй Курцвейл собрал систему, читавшую текст любым шрифтом вслух. Первым покупателем стал музыкант Стиви Уандер. Дальше техника ушла в почту и банки: индексы на конвертах и суммы на чеках машины читали задолго до того, как это стало доступно дома.
Сам движок Tesseract начался в 1985 году в лаборатории Hewlett-Packard, был заброшен в середине девяностых, а в 2005 году открыт под свободной лицензией. С 2006 года его развивает Google, и в четвёртой версии распознавание перевели на нейросеть с длинной краткосрочной памятью: сеть читает строку целиком вместо разбора по одной букве, и от этого сильно выигрывает на связном тексте.
Как снимать и настраивать, чтобы вышло чисто
Главное решается до распознавания, при съёмке. Держите камеру строго над страницей, чтобы строки шли горизонтально: наклон в несколько градусов движок ещё выправляет, а перспективу от съёмки под углом уже теряет. Ищите ровный рассеянный свет: блик от лампы выедает часть строки насовсем. Кадрируйте по границам текста, иначе узор скатерти тоже пойдёт в разбор.
Язык выбирайте строго по тексту: два языка сразу означают две модели, вдвое больше загрузки и заметно более медленную работу. Колонки распознавайте по одной, вырезав нужную часть заранее. Кнопка «Склеить переносы» убирает разрывы строк внутри абзацев и сращивает слова, разорванные дефисом. Если PDF собран из текста и сканов внутри нет, быстрее и точнее сработает PDF в текст.
| Языки | русский, английский |
| Движок | Tesseract 5, WebAssembly |
| Вес модели русского | 8,6 МБ |
| Вес движка | 4,7 МБ |
| Страница A4 | 3–7 секунд |
| Минимальная высота буквы | 20 пикселей |
| Рекомендуемый скан | 300 точек на дюйм |
| Рукописный текст | не распознаётся |
| Файл на сервер | не отправляется |
Как пользоваться
- Фотографию, скриншот, скан или PDF; можно перетащить или вставить из буфера обмена.
- Русский, английский или оба сразу — от этого зависит, какой словарь загрузится.
- Первый запуск дольше: загружается движок и языковая модель, дальше они берутся из кеша.
- Скопируйте в буфер или сохраните файлом .txt.
Частые вопросы
Насколько точно распознаётся текст
Ровный печатный текст со скана или чёткого снимка читается почти без ошибок. Фотография страницы под углом, с бликом или тенью даёт заметно хуже: движок рассчитан на прямые строки. Рукописный текст не распознаётся вообще — под него нужны совсем другие модели. Рядом с результатом показана средняя уверенность распознавания: ниже 70 процентов текст стоит перечитать глазами.
Что сделать, чтобы вышло лучше
Снимайте страницу сверху, без наклона, при ровном свете и без теней от собственной руки. Кадрируйте по границам текста: поля и посторонние предметы движок тоже пытается читать. Разрешение важнее мегапикселей камеры — буква должна быть высотой хотя бы 20 пикселей. Скан в 300 точек на дюйм почти всегда лучше любой фотографии.
Почему первый запуск такой долгий
Потому что в браузер загружается сам движок Tesseract, собранный в WebAssembly, и языковая модель: около 4,7 МБ движка и 8,6 МБ на русский язык. Всё это лежит на нашем сервере и кешируется браузером, поэтому второй и следующие разы начинаются сразу. Выбор сразу двух языков означает две модели и заметно более медленное распознавание.
Зачем выбирать язык
Движок сверяет формы букв со словарём и статистикой языка. Русский текст с английской моделью превращается в набор латиницы, потому что кириллических букв в ней просто нет. Два языка сразу нужны для документов со смешанным текстом — договоров с названиями компаний, технических инструкций, — но за это платится скоростью и небольшой потерей точности.
Файлы точно не уходят на сервер
Точно. Картинка читается из выбранного файла в память вкладки и распознаётся там же. С сервера приходят только движок и языковой файл. Ни изображение, ни распознанный текст никуда не отправляются и нигде не сохраняются.
Как обрабатывается PDF
Каждая страница рисуется на холст в двойном разрешении и распознаётся как картинка. Это нужно для сканов, где текста как такового нет — есть фотография страницы. Если PDF собран из текста, быстрее и точнее будет обычное извлечение: для этого есть отдельная страница PDF в текст.
Что происходит с разметкой
Она теряется. На выходе получается простой текст с разбивкой на строки и абзацы: таблицы превращаются в строки со значениями, колонки могут перемешаться, жирное и курсивное начертание не сохраняется. Колонки лучше распознавать по одной, вырезав нужную часть страницы заранее.
Сколько страниц потянет вкладка
Страница А4 распознаётся за несколько секунд на обычном ноутбуке, поэтому документ на два-три десятка страниц — это минуты работы. Сотню страниц лучше разбить на части: всё время работы вкладка занята, и закрывать её нельзя.
Ещё инструменты для текста
Проверка орфографии, анализ на воду и тошноту, счётчик символов, сравнение двух текстов, типографор, регистр и замены — в разделе 37 инструментов.

