Исправить кракозябры: автоподбор кодировки
Текст превратился ⠫привет» или в «Ð Ñ», и непонятно, где он сломался. Инструмент перебирает правдоподобные цепочки порчи — UTF-8, прочитанный как windows-1251, KOI8-R или IBM866, двойную перекодировку, HTML-мнемоники, процентные коды — и показывает несколько расшифровок сразу. Порядок задаёт оценка: доля кириллицы, доля пробелов и частота русских буквенных пар. Рядом видно, что именно определилось: исходная кодировка, во что её ошибочно прочитали, сколько символов и русских букв получилось на выходе. Файл .csv, .txt или .sql переводится в UTF-8; для русского Excel есть обратная выгрузка в windows-1251 и в UTF-8 с BOM.
Файл в неизвестной кодировке
Как пользоваться
- Хватит одного абзаца: подбор идёт по буквенной статистике, и длина текста мало что добавляет. Разбор запускается сразу при вставке.
- Наверх встаёт та расшифровка, которая больше похожа на русский язык. Остальные варианты лежат рядом и переключаются одной кнопкой.
- В карточках рядом с результатом видно исходную кодировку, во что её прочитали, сколько символов получилось и сколько русских букв восстановилось.
- Кнопка копирования кладёт результат в буфер. Рядом — выгрузка файлом в UTF-8, в UTF-8 с BOM или в windows-1251.
- Загрузите .csv, .txt или .sql: кодировка определится по содержимому, и скачается уже перекодированный файл с тем же содержимым.
Частые вопросы
Почему русский текст превращается ⠫привет»?
Буква в UTF-8 занимает два байта. Если программа читает эти байты по одному и считает, что перед ней windows-1251, каждая русская буква распадается на два непохожих символа. Обратная операция возвращает исходные байты и читает их уже как UTF-8. Именно эту цепочку инструмент проверяет первой.
Чем «РїСЂРёРІ» отличается от «Ð рив»?
Это одна и та же порча, прочитанная разными таблицами. Первый вид даёт windows-1251 — русская кодировка, поэтому мусор выглядит кириллицей. Второй даёт windows-1252 (она же Latin-1), которой пользуются западные системы, поэтому там вылезает латиница с диакритикой. Инструмент различает эти случаи по тому, какие символы вообще существуют в каждой таблице.
В тексте стоят ромбики «▬» или «�». Их можно вернуть?
Дословно вернуть их нельзя. Такой символ означает, что программа уже прочитала байт, не смогла его разобрать и записала вместо него заглушку — исходное значение байта при этом стёрлось. Инструмент считает, сколько таких мест в тексте, и показывает это отдельной строкой. Помогает только исходный файл до перекодировки.
Текст уходит на сервер?
Нет. Весь разбор идёт в вашем браузере: таблицы кодировок зашиты в страницу, сетевые запросы инструмент не делает. Файл, который вы выбираете, тоже читается локально и никуда не отправляется.
Почему Excel ломает мой CSV с русскими буквами?
Русская версия Excel по умолчанию открывает CSV в windows-1251 и не пытается распознать UTF-8. Есть два рабочих выхода: сохранить файл прямо в windows-1251 или оставить UTF-8, добавив в начало метку BOM — три байта EF BB BF, по которым Excel понимает кодировку. Обе выгрузки есть в блоке скачивания.
Какие кодировки инструмент знает?
UTF-8, UTF-16 с меткой BOM, windows-1251, windows-1252, KOI8-R и IBM866, плюс HTML-мнемоники вида П и процентные коды вида %D0%9F. Азиатских кодировок, ISO-8859-5, UTF-7 и cp1250 здесь нет — они дают другой рисунок мусора и требуют своих таблиц.
Насколько большой текст и файл он потянет?
Текстовое поле разбирает до 100 000 символов за раз, файл — до 4 МБ. Ограничения стоят затем, чтобы вкладка не зависла на слабом ноутбуке или телефоне: перебор гоняет каждую цепочку по всей строке. Файл побольше имеет смысл резать на части.
Всегда ли верхний вариант правильный?
На связном тексте от пары слов — почти всегда. На коротких обрывках вроде одного слова из трёх букв статистика шаткая, и соседний вариант может оказаться ближе к правде. Поэтому рядом с победившей расшифровкой показаны и остальные, вместе с оценкой похожести у каждой.
Похожие инструменты
Делит длинный текст на куски нужной длины: Telegram 4096, подпись 1024, ВК 4000, description 160, SMS 70. Не рвёт слова и предложения.
ОткрытьТипографорКавычки-ёлочки «», дефис → тире, неразрывные пробелы после предлогов, чистка двойных пробелов. Аккуратная типографика для сайта.
ОткрытьОбрезать строкиУдалить N символов с краёв, текст до/после символа, убрать приставку или окончание.
ОткрытьСчётчик символов и словСимволы, слова, предложения, время чтения + частотность слов и повторяющихся фраз (ключей). Для копирайтинга и SEO.
ОткрытьАнализ текста: тошнотаКлассическая и академическая тошнота, водность, символы, слова и частотность ключей. Проверка SEO-текста перед публикацией.
ОткрытьMarkdown ↔ HTMLПереводит Markdown в чистый HTML и обратно: заголовки, списки, ссылки, жирный, код, цитаты. Удобно, когда нейросеть выдала Markdown.
ОткрытьЕщё инструменты для SEO и маркетинга
Кластеризатор запросов, генераторы sitemap и robots.txt, минус-слова, разметка Schema.org и калькуляторы — в разделе инструментов.