ГлавнаяИнструментыИсправить кракозябры: автоподбор кодировки

Исправить кракозябры: автоподбор кодировки

Текст превратился ⠫привет» или в «Ð Ñ», и непонятно, где он сломался. Инструмент перебирает правдоподобные цепочки порчи — UTF-8, прочитанный как windows-1251, KOI8-R или IBM866, двойную перекодировку, HTML-мнемоники, процентные коды — и показывает несколько расшифровок сразу. Порядок задаёт оценка: доля кириллицы, доля пробелов и частота русских буквенных пар. Рядом видно, что именно определилось: исходная кодировка, во что её ошибочно прочитали, сколько символов и русских букв получилось на выходе. Файл .csv, .txt или .sql переводится в UTF-8; для русского Excel есть обратная выгрузка в windows-1251 и в UTF-8 с BOM.

0 символов
Считается в браузере. За раз разбирается до 100 000 символов.

Файл в неизвестной кодировке

Перетащите сюда .csv, .txt или .sql — или нажмите и выберите файл. До 4 МБ, файл читается локально.

Как пользоваться

  1. Хватит одного абзаца: подбор идёт по буквенной статистике, и длина текста мало что добавляет. Разбор запускается сразу при вставке.
  2. Наверх встаёт та расшифровка, которая больше похожа на русский язык. Остальные варианты лежат рядом и переключаются одной кнопкой.
  3. В карточках рядом с результатом видно исходную кодировку, во что её прочитали, сколько символов получилось и сколько русских букв восстановилось.
  4. Кнопка копирования кладёт результат в буфер. Рядом — выгрузка файлом в UTF-8, в UTF-8 с BOM или в windows-1251.
  5. Загрузите .csv, .txt или .sql: кодировка определится по содержимому, и скачается уже перекодированный файл с тем же содержимым.

Частые вопросы

Почему русский текст превращается ⠫привет»?

Буква в UTF-8 занимает два байта. Если программа читает эти байты по одному и считает, что перед ней windows-1251, каждая русская буква распадается на два непохожих символа. Обратная операция возвращает исходные байты и читает их уже как UTF-8. Именно эту цепочку инструмент проверяет первой.

Чем «РїСЂРёРІ» отличается от «Ð рив»?

Это одна и та же порча, прочитанная разными таблицами. Первый вид даёт windows-1251 — русская кодировка, поэтому мусор выглядит кириллицей. Второй даёт windows-1252 (она же Latin-1), которой пользуются западные системы, поэтому там вылезает латиница с диакритикой. Инструмент различает эти случаи по тому, какие символы вообще существуют в каждой таблице.

В тексте стоят ромбики «▬» или «�». Их можно вернуть?

Дословно вернуть их нельзя. Такой символ означает, что программа уже прочитала байт, не смогла его разобрать и записала вместо него заглушку — исходное значение байта при этом стёрлось. Инструмент считает, сколько таких мест в тексте, и показывает это отдельной строкой. Помогает только исходный файл до перекодировки.

Текст уходит на сервер?

Нет. Весь разбор идёт в вашем браузере: таблицы кодировок зашиты в страницу, сетевые запросы инструмент не делает. Файл, который вы выбираете, тоже читается локально и никуда не отправляется.

Почему Excel ломает мой CSV с русскими буквами?

Русская версия Excel по умолчанию открывает CSV в windows-1251 и не пытается распознать UTF-8. Есть два рабочих выхода: сохранить файл прямо в windows-1251 или оставить UTF-8, добавив в начало метку BOM — три байта EF BB BF, по которым Excel понимает кодировку. Обе выгрузки есть в блоке скачивания.

Какие кодировки инструмент знает?

UTF-8, UTF-16 с меткой BOM, windows-1251, windows-1252, KOI8-R и IBM866, плюс HTML-мнемоники вида П и процентные коды вида %D0%9F. Азиатских кодировок, ISO-8859-5, UTF-7 и cp1250 здесь нет — они дают другой рисунок мусора и требуют своих таблиц.

Насколько большой текст и файл он потянет?

Текстовое поле разбирает до 100 000 символов за раз, файл — до 4 МБ. Ограничения стоят затем, чтобы вкладка не зависла на слабом ноутбуке или телефоне: перебор гоняет каждую цепочку по всей строке. Файл побольше имеет смысл резать на части.

Всегда ли верхний вариант правильный?

На связном тексте от пары слов — почти всегда. На коротких обрывках вроде одного слова из трёх букв статистика шаткая, и соседний вариант может оказаться ближе к правде. Поэтому рядом с победившей расшифровкой показаны и остальные, вместе с оценкой похожести у каждой.

Похожие инструменты

Разбить текст на части

Делит длинный текст на куски нужной длины: Telegram 4096, подпись 1024, ВК 4000, description 160, SMS 70. Не рвёт слова и предложения.

Открыть
Типографор

Кавычки-ёлочки «», дефис → тире, неразрывные пробелы после предлогов, чистка двойных пробелов. Аккуратная типографика для сайта.

Открыть
Обрезать строки

Удалить N символов с краёв, текст до/после символа, убрать приставку или окончание.

Открыть
Счётчик символов и слов

Символы, слова, предложения, время чтения + частотность слов и повторяющихся фраз (ключей). Для копирайтинга и SEO.

Открыть
Анализ текста: тошнота

Классическая и академическая тошнота, водность, символы, слова и частотность ключей. Проверка SEO-текста перед публикацией.

Открыть
Markdown ↔ HTML

Переводит Markdown в чистый HTML и обратно: заголовки, списки, ссылки, жирный, код, цитаты. Удобно, когда нейросеть выдала Markdown.

Открыть

Ещё инструменты для SEO и маркетинга

Кластеризатор запросов, генераторы sitemap и robots.txt, минус-слова, разметка Schema.org и калькуляторы — в разделе инструментов.