Text/Clean

Практические руководства

Разбор типичных ситуаций — текст из PDF, таблица из Excel, повторы в списке имён — и того, в каком порядке операций их удобнее всего решать.

01Как исправить разорванные переносы строк в тексте, скопированном из PDFПочему текст из PDF обрывается посреди предложения и как восстановить переносы, склеить слова с дефисом и убрать номера страниц и колонтитулы — пошагово, с примером.02Очистка данных, вставленных из Excel и Google ТаблицКак таблица из Excel или Google Таблиц превращается в табуляции, как убрать NBSP, лишние пробелы и пустые строки, заменить табуляции запятыми и вытащить столбец.03Как удалить повторы из списков имён и адресов почты и отсортировать ихКак удалить повторяющиеся имена и адреса почты после объединения списков и отсортировать их — и почему пробелы или регистр мешают найти дубликаты. С примерами.04Как превратить веб-страницу или HTML-код в простой текстКак удалить HTML-теги и сохранить абзацы: убрать script и style, раскрыть сущности вроде &, превратить таблицы в табуляции. Чем это отличается от копирования.05Поиск и замена: готовые шаблоны регулярных выраженийГотовые шаблоны поиска и замены на регулярных выражениях JavaScript: смена формата даты, маскировка телефонов, удаление скобок и пробелов, ссылки на группы $1.06Полноширинные, полуширинные и невидимые символы: как их убратьКак найти и убрать полноширинные символы, NBSP, пробелы нулевой ширины, BOM и разложенный хангыль (NFD), когда поиск, ВПР или удаление дубликатов не срабатывают.07Список в SQL IN, массив JSON, список Markdown или HTMLКак превратить список «одно значение на строку» в условие SQL IN, массив JSON, список Markdown или HTML: кавычки, склейка через запятую, экранирование кавычек.