Text/Clean

全角・半角と目に見えない文字を整理する

同じに見えるのに検索・VLOOKUP・重複削除が失敗する原因となる全角英数字、全角スペース、NBSP、ゼロ幅スペース、BOM、分解された文字(NFD)を見つけて整理する方法。

Excel の VLOOKUP が確かにあるはずの値を見つけられない、コピーしたハッシュタグのリンクが機能しない、ファイル名の濁点が か゛ のように分かれて見える。こうした場合は、目に見えない文字の違いが原因である可能性が高いでしょう。画面では同じ文字に見えても、コンピューターが比較しているのは文字コードだからです。

よく出会う文字

  • 全角英数字・記号: Unicode の U+FF01〜U+FF5E の範囲にある ABC123!@ です。日中韓の入力システムの全角モードで入力され、半角の ASCII(U+0021〜U+007E)とはコードが異なります。全角数字はスプレッドシートで数値として認識されないことがあり、全角の を含むメールアドレスは形式エラーになります。
  • 全角スペース(U+3000): 日中韓の文書で使われる、文字幅の空白です。
  • NBSP(U+00A0): 改行なし空白です。HTML の   がこの文字で、Webページからコピーしたテキストによく混ざります。Excel の TRIM 関数は通常の空白を削除する関数なので、NBSP は残ります。
  • ゼロ幅スペース(U+200B): 幅が0なので、まったく見えません。Webエディターやメッセンジャーからコピーしたテキストに紛れ込み、ハッシュタグやURLを途切れさせます。
  • BOM(U+FEFF): ファイルの先頭に付くバイトオーダーマークです。メモ帳などで保存された BOM 付き UTF-8 ファイルからコピーすると、1行目の最初の値の前に隠れて入り込み、最初の値だけ比較に失敗する原因になります。

分解された文字(NFC と NFD)

Unicode では、ハングルの を1つのコード(U+D55C)で書く方法(NFC)と、字母 (U+1112) (U+1161) (U+11AB)の3つで書く方法(NFD)の両方が認められています。日本語でも は1文字(U+304C)でも、(U+304B)と結合用の濁点(U+3099)の2文字でも表せます。どちらも同じ文字として表示されますが、文字列としては別物です。macOS で作ったファイル名や macOS から持ってきた一部のテキストには NFD の文字が含まれていることがあり、NFD を合成して表示できない環境で見ると、字母や濁点が分かれて見えます。表示に問題がなくても NFC の文字と比べると別の値になり、検索や重複の削除が失敗します。

整理のパイプライン

  1. 見えない文字・引用符の整理 — 既定のオプションのまま使えば、NFC 正規化で分解された文字を結合し、ゼロ幅文字・BOM を削除し、NBSP などの特殊な空白を通常の空白に変えます。カーリー引用符もストレート引用符になります。
  2. 全角 ↔ 半角の変換 — 方向を「全角 → 半角」にすると、U+FF01〜U+FF5E の文字を ASCII に変換します。「空白も変換」をオンにしておけば、全角スペースも通常の空白になります。
  3. 前後の空白を削除 — 変換された空白のうち、行の前後にあるものを削除します。
KIM minsu​@example.com
合計:1,200円

上の入力(KIM の後ろに全角スペース、minsu の後ろにゼロ幅スペースが隠れています)は次のように整理されます。

KIM minsu@example.com
合計:1,200円

注意点

  • 全角 → 半角はハングル・漢字・かなは変えませんが、日本語・中国語の文中の全角の句読点・記号( )も半角に変えます。文の見た目を保つ必要がある原稿なら、英数字だけの部分に限って適用してください。
  • ウォン記号 (U+FFE6)と円記号 (U+FFE5)は変換範囲(U+FF01〜U+FF5E)の外なので変わりません。
  • 「半角カタカナ → 全角」のオプションは、方向が「半角 → 全角」のときだけ適用されます。
  • NFC 正規化は分解された文字を結合するだけで、 のような互換文字を 1 kg IV には変えません。こうした文字は元の形のまま残ります。
  • 逆に半角を全角にする「半角 → 全角」は、日本の書式のように全角入力を求められるフォームを埋めるときに使います。このとき通常の空白も全角スペースに変わるので、不要なら「空白も変換」をオフにしてください。
  • ゼロ幅接合子(U+200D)を削除すると、👨‍👩‍👧 のような結合絵文字が個別の絵文字にばらけます。絵文字を残す必要がある文章なら、「ゼロ幅文字・BOM を削除」をオフにしてください。

どこから紛れ込むのか

  • 日本や中国のサイト、古い韓国の公的機関の文書、日中韓の入力システムの全角モードで入力した値には、全角英数字が混ざりやすくなります。
  • Webページをコピーすると、  と書かれた NBSP が付いてきます。文末や名前の間によくあります。
  • メッセンジャーや SNS のリンクプレビュー、エディターからコピーしたテキストには、ゼロ幅スペースが挟まっていることもあります。

Excel の CLEAN 関数はコード0〜31の制御文字を削除する関数なので、NBSP・ゼロ幅スペース・全角文字は処理しません。シート上で解決できない値は、このツールで整理してから貼り直してください。

隠れた文字を見つける方法

整理する前に、どの行に問題があるかを見たいなら、行フィルター を「含む行だけ残す」と「正規表現」にして、検索する内容に [ ​ !-~] を入れてください。該当する文字が含まれる行だけが残るので、原因となったデータを確認できます。確認が終わったら、このステップはオフにするか削除します。

チェックリスト

  • 比較に失敗したら、まず見えない文字を疑う。
  • 「見えない文字・引用符の整理」を全角変換より前に置く。
  • 日本語・中国語の原稿には、全角変換を部分的にだけ使う。

最終更新: 2026-09-23