Text/Clean

Полноширинные, полуширинные и невидимые символы: как их убрать

Как найти и убрать полноширинные символы, NBSP, пробелы нулевой ширины, BOM и разложенный хангыль (NFD), когда поиск, ВПР или удаление дубликатов не срабатывают.

Если ВПР в Excel не находит значение, которое точно есть, скопированная ссылка-хештег не работает или корейские имена файлов выглядят рассыпанными, как ㅎㅏㄴㄱㅡㄹ, — скорее всего, дело в невидимых различиях между символами. На экране символы выглядят одинаково, но компьютер сравнивает их коды.

Символы, которые встречаются чаще всего

  • Полноширинные буквы, цифры и знаки: символы ABC123!@ из диапазона Unicode U+FF01–U+FF5E. Их вводят в полноширинном режиме китайских, японских и корейских методов ввода, и их коды отличаются от полуширинных символов ASCII (U+0021–U+007E). Электронные таблицы часто не распознают полноширинные цифры как числа, а адрес почты с полноширинным считается неверным.
  • Полноширинный пробел (U+3000): пробел шириной в символ, который используется в китайских, японских и корейских документах.
  • NBSP (U+00A0): неразрывный пробел. Это то же, что   в HTML; он часто попадает в текст, скопированный с веб-страниц. Функция Excel СЖПРОБЕЛЫ (TRIM) удаляет только обычные пробелы, NBSP остаётся.
  • Пробел нулевой ширины (U+200B): имеет нулевую ширину и совершенно невидим. Попадает в текст, скопированный из веб-редакторов и мессенджеров, и разрывает хештеги и URL.
  • BOM (U+FEFF): метка порядка байтов в начале файла. Если копировать из файла с UTF-8 BOM, например сохранённого в «Блокноте», она прячется перед первым значением первой строки, и сравнение не срабатывает только для первого значения.

Разложенные слоги хангыля (NFC и NFD)

Unicode позволяет записать корейский слог одной кодовой точкой (U+D55C) — это NFC, или тремя буквами чамо (U+1112), (U+1161), (U+11AB) — это NFD. Оба варианта отображаются как один и тот же символ, но как строки различаются. Имена файлов, созданные в macOS, и некоторые тексты, перенесённые из macOS, содержат хангыль в форме NFD, и в средах, не умеющих собирать NFD при отображении, слоги выглядят рассыпанными. Даже если отображение в порядке, при сравнении с хангылем в NFC значения окажутся разными, и поиск и удаление повторов не сработают. То же касается кириллицы: й и ё иногда хранятся как и или е плюс отдельный диакритический знак.

Конвейер очистки

  1. Очистка невидимых символов и кавычек — с параметрами по умолчанию нормализация NFC собирает разложенные символы, удаляются символы нулевой ширины и BOM, а NBSP и другие особые пробелы становятся обычными. Типографские кавычки тоже становятся прямыми.
  2. Полноширинные ↔ полуширинные символы — с направлением «Полноширинные → полуширинные» символы U+FF01–U+FF5E превращаются в ASCII. Если включено «Преобразовывать и пробелы», полноширинный пробел тоже становится обычным.
  3. Удаление пробелов по краям — удаляет те из преобразованных пробелов, что оказались в начале или конце строки.
KIM minsu​@example.com
合計:1,200円

Такой ввод (после KIM спрятан полноширинный пробел, после minsu — пробел нулевой ширины) очищается так.

KIM minsu@example.com
合計:1,200円

На что обратить внимание

  • «Полноширинные → полуширинные» не меняет хангыль, иероглифы и кану, но превращает в полуширинные и полноширинные знаки препинания в японских и китайских предложениях ( ). Если в рукописи нужно сохранить облик текста, применяйте операцию только к фрагментам с буквами и цифрами.
  • Знак воны (U+FFE6) и знак иены (U+FFE5) лежат вне диапазона преобразования (U+FF01–U+FF5E) и не меняются.
  • Параметр «Полуширинная катакана → полноширинная» работает только при направлении «Полуширинные → полноширинные».
  • Нормализация NFC лишь собирает разложенные символы и не превращает символы совместимости вроде в 1 kg IV. Они остаются в исходном виде.
  • Обратное направление «Полуширинные → полноширинные» нужно, чтобы заполнять бланки, требующие полноширинных символов, как японские формы. При этом обычные пробелы тоже становятся полноширинными; если это не нужно, выключите «Преобразовывать и пробелы».
  • Если удалить соединитель нулевой ширины (U+200D), составные эмодзи вроде 👨‍👩‍👧 распадутся на отдельные эмодзи. Если эмодзи нужно сохранить, выключите «Удалять символы нулевой ширины и BOM».

Откуда они берутся

  • Полноширинные буквы и цифры легко попадают в значения с японских и китайских сайтов, из старых документов корейских госучреждений и из полноширинного режима восточноазиатских методов ввода.
  • При копировании веб-страниц вместе с текстом приходят NBSP, записанные как  . Часто они стоят в конце предложения, между именем и фамилией или между числом и единицей измерения.
  • В тексте из предпросмотра ссылок в мессенджерах и соцсетях или из редакторов иногда прячутся пробелы нулевой ширины.

Функция Excel ПЕЧСИМВ (CLEAN) удаляет управляющие символы с кодами 0–31 и не трогает NBSP, пробелы нулевой ширины и полноширинные символы. Значения, которые не удаётся очистить в таблице, очистите этим инструментом и вставьте обратно.

Как найти скрытые символы

Если перед очисткой нужно увидеть, в каких строках проблема, выберите у Фильтр строк «Оставить только строки с совпадением» и «Регулярное выражение» и введите в поиск [ ​ !-~]. Останутся только строки, где есть эти символы, и вы сможете проверить проблемные данные. После проверки выключите или удалите этот шаг.

Чек-лист

  • Если сравнение не срабатывает, сначала подозревайте невидимые символы.
  • Очистку невидимых символов и кавычек ставьте перед преобразованием ширины.
  • В японских и китайских рукописях применяйте преобразование ширины только к отдельным фрагментам.

Последнее обновление: 2026-09-23