DjVu в PDF

Открывает книгу или скан в формате DjVu и собирает из страниц обычный PDF того же размера и разрешения. Всё считается в браузере: файл в сотни страниц никуда не загружается и открывается потом в любой читалке.

Файл пока не выбран.

Декодирование DjVu и сборка PDF идут внутри браузера. Библиотека DjVu.js распространяется по лицензии GNU GPL v2, файл никуда не отправляется.

Как страницы DjVu превращаются в PDF

Конвертер открывает DjVu целиком в браузере: библиотека DjVu.js разбирает контейнер, раскладывает каждую страницу на маску текста, фон и передний план, собирает из них картинку и отдаёт её на canvas. Дальше страница уходит в JPEG с выбранным качеством или в PNG без потерь и ложится на лист PDF, размер которого считается из разрешения файла: страница 2480 на 3508 точек при 300 dpi даёт ровно A4. Страницы обрабатываются по одной с индикатором, поэтому книга на сотни страниц проходит без загрузки на сервер.

Если в DjVu записан распознанный текст, конвертер кладёт его невидимым слоем поверх картинки каждой страницы, и поиск по PDF работает. Первые три страницы показываются миниатюрами, чтобы сверить качество до скачивания. Вариант «вдвое меньше» по разрешению годится для чтения с телефона и режет размер файла в четыре раза; для печати и чертежей стоит оставлять разрешение как в файле и выбирать PNG. Готовый файл открывается в любой читалке, отправляется по почте и печатается без плагинов, которых требует DjVu.

Стеллажи библиотеки
Библиотечные сканы книг чаще всего хранятся в DjVu: формат придуман для дешёвого хранения страниц. Фото: Викисклад, CC0.
НастройкаЧто даётКогда выбирать
JPEG, высокое качествофайл в 3–5 раз меньше PNGкниги и статьи для чтения
PNG без потерькаждый пиксель как в сканечертежи, ноты, мелкий текст
Разрешение вдвое меньшефайл в 4 раза легчечтение с телефона
Скрытый текстпоиск по PDFсканы из библиотек с распознанным слоем

История: формат из лабораторий AT&T и его российская судьба

Формат DjVu придумали в 1996 году в лабораториях AT&T Ян Лекун, Леон Ботту и Патрик Хаффнер: страницу разделяли на чёрно-белую маску букв, которую сжимали особым алгоритмом, и цветной фон в низком разрешении. Скан книжной страницы весил 30–60 килобайт вместо мегабайта в JPEG, и в эпоху модемов это решало. В 2000 году AT&T продала формат компании LizardTech, а в 2001 году вышла свободная библиотека DjVuLibre, на которой держатся все просмотрщики до сих пор.

В России DjVu стал форматом библиотек: в нём выложены сотни тысяч сканов учебников, журналов и дореволюционных изданий, потому что PDF тех же книг весил в разы больше. Читалки на телефонах и планшетах формат поддерживают через плагины и не всегда, поэтому старые сканы всё чаще переводят в PDF. Декодер DjVu.js, который работает здесь, написан на JavaScript в 2017 году и разбирает файлы прямо в браузере без сервера.

Страница старинной рукописи
Страницы старых книг сканировали в DjVu ради экономии места: маска текста сжимается лучше картинки. Фото: Викисклад, общественное достояние.
Планшетный сканер
Сканер: разрешение 300 или 600 dpi записывается в DjVu, и конвертер восстанавливает по нему размер листа. Фото: Luke Launderville, CC BY-SA 3.0.

Как собрать PDF и что делать с многофайловым DjVu

Перетащите файл в поле: число страниц, размер и разрешение покажутся сразу. Для чтения оставьте JPEG высокого качества, для чертежей выберите PNG, для телефона уменьшите разрешение вдвое. Оставьте галочку скрытого текста, если хотите искать по книге, и нажмите «Собрать PDF»: индикатор покажет ход по страницам, первые три страницы появятся миниатюрами, готовый файл скачается с именем исходника.

Многофайловый DjVu, где индексный файл ссылается на отдельные страницы, конвертер не откроет: соберите его в один файл в DjVuLibre или попросите единый файл у источника. Тяжёлый результат ужимает сжатие PDF, лишние страницы убирает разделение PDF, а если текстового слоя в скане не было, его сделает распознавание текста.

Формат DjVu1996 год, AT&T
Свободная библиотекаDjVuLibre, 2001
Декодер здесьDjVu.js, GNU GPL v2
Размер листапо dpi файла
Картинки страницJPEG или PNG
Текстовый слойневидимый, для поиска
Скоростьоколо секунды на страницу
Файл на серверне уходит

Как пользоваться

  1. Перетащите его в поле или нажмите на него. Число страниц, размер и dpi покажутся сразу.
  2. JPEG даёт файл в разы меньше, PNG хранит страницу без потерь; разрешение можно уменьшить вдвое.
  3. Если в DjVu есть распознанный текст, он ляжет в PDF невидимым слоем, и поиск по книге заработает.
  4. Страницы обрабатываются по одной с индикатором, готовый файл скачивается с тем же именем.

Частые вопросы

Как перевести DjVu в PDF без программ

Перетащите файл в поле выше и нажмите «Собрать PDF». Декодер DjVu работает внутри браузера на JavaScript: каждая страница раскладывается на маску текста, фон и передний план, собирается в картинку и ложится на страницу PDF с теми же физическими размерами, что записаны в dpi исходника. Устанавливать WinDjView, DjVuLibre или плагины не нужно, на телефоне работает так же.

В каком качестве получится PDF

В том же, что и исходный DjVu: страницы не масштабируются, разрешение берётся из файла, обычно 300 или 600 точек на дюйм. Формат JPEG с высоким качеством почти не отличается от оригинала на глаз и даёт файл в три-пять раз меньше, чем PNG; PNG хранит каждый пиксель без потерь и нужен для чертежей и мелкого текста. Для чтения с телефона хватает варианта «вдвое меньше».

Будет ли в PDF работать поиск по тексту

Да, если в DjVu был скрытый текстовый слой: сканы книг из библиотек обычно его содержат. Конвертер кладёт текст каждой страницы невидимым слоем поверх картинки, и поиск в читалке находит слова, хотя подсветка попадает не точно в строку. Если слоя в файле нет, PDF получится без него; распознать текст со скана умеет распознавание текста.

Почему файл PDF больше, чем DjVu

DjVu сжимает страницу хитрее: текст хранится отдельной чёрно-белой маской, а фон в низком разрешении, поэтому 300 страниц занимают 20–40 мегабайт. PDF хранит каждую страницу целиком как картинку, и файл вырастает в два-четыре раза. Уменьшить его можно вариантом «вдвое меньше» по разрешению или обычным качеством JPEG, а готовый файл ужимает сжатие PDF.

Что делать, если файл не открывается

Чаще всего это многофайловый DjVu: индексный файл ссылается на отдельные файлы страниц, которых рядом нет. Конвертер работает с обычными единым файлом, где все страницы внутри. Файлы с расширением .djv открываются так же, как .djvu. Повреждённый файл декодер остановит с сообщением о первой битой странице.

Куда отправляется книга

Никуда. Декодер и сборщик PDF работают в вашем браузере, файл остаётся на устройстве. Скорость зависит от компьютера: страница книги в 300 dpi обрабатывается примерно за секунду, том на 400 страниц займёт несколько минут.

Можно ли перевести PDF обратно в DjVu

Здесь нет: обратный конвертер требует кодировщика DjVu, который в браузере работает медленно и даёт файлы хуже оригинала. Хранить книги удобнее в PDF: его открывает любое устройство без плагинов, а DjVu постепенно уходит даже из библиотек.

Похожие инструменты

Сжать PDF

Уменьшает вес пересборкой страниц в картинки. Показывает результат до сохранения и предупреждает, когда сжатие убьёт текстовый слой.

Открыть
Разделить PDF

Извлекает нужные страницы, удаляет лишние и разбивает документ на отдельные файлы. Всё считается в браузере.

Открыть
Распознать текст с картинки

OCR в браузере: текст с фотографии, скриншота, скана и страниц PDF по-русски и по-английски, с уверенностью распознавания и склейкой переносов.

Открыть
Подписать PDF

Подпись мышью, пальцем, рукописным шрифтом или со скана без белого фона: ставится на страницу или сразу на все, рядом дата и печать.

Открыть
Замазать текст в PDF

Чёрный или белый прямоугольник поверх данных: страница сохраняется картинкой, и закрытый текст из файла исчезает. Остальные страницы не трогаются.

Открыть
Редактор PDF

Надпись, подпись, печать, галочка и карандаш поверх страницы, замазка, после которой текст исчезает из файла, маркер. Документ собирается в браузере.

Открыть

Ещё инструменты для документов и денег

НДС и сумма прописью, проверка чека по QR-коду, переработки и алименты, объединение, сжатие и перевод PDF — в разделе 83 инструмента.