Инструмент очистки текста, который выстраивает операции по порядку и выполняет их за один проход
TextClean — бесплатный веб-инструмент, в котором собраны самые частые операции по очистке текста: нормализация пробелов, удаление пустых и повторяющихся строк, сортировка, поиск и замена, удаление HTML-тегов и эмодзи, преобразование полноширинных и полуширинных символов, восстановление переносов строк в тексте из PDF. Вместо того чтобы запускать операции по одной, вы собираете из нужных шагов конвейер — и сразу после вставки текста видите результат, к которому последовательно применены все шаги. Часто используемые конвейеры можно сохранить как рецепт и в следующий раз загрузить одним нажатием. Вся обработка идёт только в браузере, введённый текст не отправляется ни на какой сервер.
Основные возможности
Конвейер из операций
Выстраивайте 19 операций очистки в любом порядке. Каждый шаг можно включить или выключить, переместить или удалить, а у каждого шага показано число строк после обработки — сразу видно, на каком шаге и что изменилось.
Результат без ожидания
Стоит вставить текст или изменить параметр — и весь конвейер выполняется заново. Даже десятки тысяч строк браузер обрабатывает мгновенно.
Сохранение рецептов и обмен ими
Часто используемые конвейеры сохраняются в браузере под понятным названием. В ссылку для обмена попадает только набор операций, текст в неё не входит.
Восстановление переносов из PDF
Переносы посреди предложения, которые появляются при копировании из PDF, склеиваются, а границы абзацев сохраняются. Английские слова, разорванные дефисом в конце строки, тоже восстанавливаются.
Поддержка разных языков
Учтены особенности разных языков: сортировка корейского по алфавиту хангыля, склейка предложений на китайском, японском и корейском, преобразование полноширинных и полуширинных символов, нормализация Unicode NFC.
Никакой передачи на сервер
Вся обработка выполняется JavaScript в браузере. Введённый текст не сохраняется и не передаётся; сохраняются только рецепты и настройки отображения.
Как пользоваться
- Вставьте текст, который нужно очистить, в поле ввода.
- Нажмите нужную операцию в списке — она добавится в конец конвейера. Или загрузите встроенный рецепт из меню рецептов.
- Настройте параметры каждого шага, меняйте порядок стрелками или временно отключайте шаги переключателем и сравнивайте результаты.
- Скопируйте результат или сохраните его в файл .txt. Чтобы продолжить обработку результата, нажмите «Результат во ввод».
- Если одна и та же очистка нужна часто, сохраните её кнопкой «Сохранить» как рецепт и в следующий раз загружайте одним нажатием.
Встроенные рецепты
- Очистка невидимых символов и кавычек
- Восстановление переносов из PDF
- Сжатие повторных пробелов и табуляций
- Удаление пробелов по краям
- Удаление пробелов по краям
- Удаление пустых строк
- Удаление повторяющихся строк
- Сортировка
- Удаление HTML-тегов
- Очистка невидимых символов и кавычек
- Удаление пробелов по краям
- Удаление пустых строк
- Сжатие повторных пробелов и табуляций
- Удаление пробелов по краям
- Удаление пустых строк
- Удаление повторяющихся строк
- Добавление символов в начало и конец строк
- Удаление переносов строк (склейка в одну строку)
- Удаление эмодзи
- Очистка невидимых символов и кавычек
- Сжатие повторных пробелов и табуляций
- Удаление пробелов по краям
- Удаление пустых строк
Частые вопросы
Сохраняется ли введённый текст на сервере?
Нет. Вся обработка происходит только в вашем браузере, и текст никуда не отправляется. В хранилище браузера (localStorage) остаются только состав конвейера, сохранённые рецепты и тема оформления; введённый текст не сохраняется.
Влияет ли порядок операций на результат?
Да. Конвейер применяется сверху вниз. Например, если поставить удаление пробелов по краям перед удалением повторяющихся строк, строки, различающиеся только пробелами, будут считаться одинаковыми. Нумерацию обычно ставят после сортировки, а удаление переносов строк — в самый конец.
Какой синтаксис у регулярных выражений?
Используется синтаксис регулярных выражений JavaScript, встроенный в браузер. Поиск и замена выполняются с глобальным поиском (g) и многострочным режимом (m), поэтому ^ и $ совпадают с началом и концом каждой строки. В строке замены можно ссылаться на группы в скобках через $1, $2. Если выражение некорректно, на шаге появится сообщение об ошибке, и шаг будет пропущен.
Восстановление переносов из PDF неправильно склеивает или делит абзацы.
В тексте из PDF нет сведений об абзацах, поэтому они угадываются по длине строк и знакам препинания. Если абзацы сливаются, держите включённым параметр «Считать короткую строку со знаком препинания концом абзаца»; если абзацы дробятся слишком мелко, выключите его. Если в текст затесались колонтитулы или номера страниц, лучше сначала удалить их фильтром строк на предыдущем шаге.
Смена регистра — только базовые варианты?
Доступны четыре варианта: верхний регистр, нижний регистр, заглавная в начале предложения и заглавная в начале каждого слова. Преобразование в нотации вроде camelCase или snake_case в задачи этого инструмента не входит.
Насколько длинный текст можно обработать?
Зависит от устройства, но на обычном компьютере даже сотни тысяч строк обрабатываются за несколько секунд. Если ввод очень большой, результат обновляется через мгновение после того, как вы перестанете печатать.
Можно ли пользоваться сохранёнными рецептами на другом устройстве?
Рецепты хранятся только в текущем браузере. Чтобы использовать рецепт на другом устройстве, скопируйте его адрес кнопкой «Ссылка для обмена» и откройте его там. Ссылка содержит только состав конвейера.