全角・半角と目に見えない文字を整理する
同じに見えるのに検索・VLOOKUP・重複削除が失敗する原因となる全角英数字、全角スペース、NBSP、ゼロ幅スペース、BOM、分解された文字(NFD)を見つけて整理する方法。
Excel の VLOOKUP が確かにあるはずの値を見つけられない、コピーしたハッシュタグのリンクが機能しない、ファイル名の濁点が か゛ のように分かれて見える。こうした場合は、目に見えない文字の違いが原因である可能性が高いでしょう。画面では同じ文字に見えても、コンピューターが比較しているのは文字コードだからです。
よく出会う文字
- 全角英数字・記号: Unicode の U+FF01〜U+FF5E の範囲にある
ABC123!@です。日中韓の入力システムの全角モードで入力され、半角の ASCII(U+0021〜U+007E)とはコードが異なります。全角数字はスプレッドシートで数値として認識されないことがあり、全角の@を含むメールアドレスは形式エラーになります。 - 全角スペース(U+3000): 日中韓の文書で使われる、文字幅の空白です。
- NBSP(U+00A0): 改行なし空白です。HTML の
がこの文字で、Webページからコピーしたテキストによく混ざります。Excel の TRIM 関数は通常の空白を削除する関数なので、NBSP は残ります。 - ゼロ幅スペース(U+200B): 幅が0なので、まったく見えません。Webエディターやメッセンジャーからコピーしたテキストに紛れ込み、ハッシュタグやURLを途切れさせます。
- BOM(U+FEFF): ファイルの先頭に付くバイトオーダーマークです。メモ帳などで保存された BOM 付き UTF-8 ファイルからコピーすると、1行目の最初の値の前に隠れて入り込み、最初の値だけ比較に失敗する原因になります。
分解された文字(NFC と NFD)
Unicode では、ハングルの 한 を1つのコード(U+D55C)で書く方法(NFC)と、字母 ᄒ(U+1112) ᅡ(U+1161) ᆫ(U+11AB)の3つで書く方法(NFD)の両方が認められています。日本語でも が は1文字(U+304C)でも、か(U+304B)と結合用の濁点(U+3099)の2文字でも表せます。どちらも同じ文字として表示されますが、文字列としては別物です。macOS で作ったファイル名や macOS から持ってきた一部のテキストには NFD の文字が含まれていることがあり、NFD を合成して表示できない環境で見ると、字母や濁点が分かれて見えます。表示に問題がなくても NFC の文字と比べると別の値になり、検索や重複の削除が失敗します。
整理のパイプライン
- 見えない文字・引用符の整理 — 既定のオプションのまま使えば、NFC 正規化で分解された文字を結合し、ゼロ幅文字・BOM を削除し、NBSP などの特殊な空白を通常の空白に変えます。カーリー引用符もストレート引用符になります。
- 全角 ↔ 半角の変換 — 方向を「全角 → 半角」にすると、U+FF01〜U+FF5E の文字を ASCII に変換します。「空白も変換」をオンにしておけば、全角スペースも通常の空白になります。
- 前後の空白を削除 — 変換された空白のうち、行の前後にあるものを削除します。
KIM minsu@example.com 合計:1,200円
上の入力(KIM の後ろに全角スペース、minsu の後ろにゼロ幅スペースが隠れています)は次のように整理されます。
KIM minsu@example.com 合計:1,200円
注意点
- 全角 → 半角はハングル・漢字・かなは変えませんが、日本語・中国語の文中の全角の句読点・記号(
!?:,)も半角に変えます。文の見た目を保つ必要がある原稿なら、英数字だけの部分に限って適用してください。 - ウォン記号
₩(U+FFE6)と円記号¥(U+FFE5)は変換範囲(U+FF01〜U+FF5E)の外なので変わりません。 - 「半角カタカナ → 全角」のオプションは、方向が「半角 → 全角」のときだけ適用されます。
- NFC 正規化は分解された文字を結合するだけで、
①㎏Ⅳのような互換文字を1kgIVには変えません。こうした文字は元の形のまま残ります。 - 逆に半角を全角にする「半角 → 全角」は、日本の書式のように全角入力を求められるフォームを埋めるときに使います。このとき通常の空白も全角スペースに変わるので、不要なら「空白も変換」をオフにしてください。
- ゼロ幅接合子(U+200D)を削除すると、👨👩👧 のような結合絵文字が個別の絵文字にばらけます。絵文字を残す必要がある文章なら、「ゼロ幅文字・BOM を削除」をオフにしてください。
どこから紛れ込むのか
- 日本や中国のサイト、古い韓国の公的機関の文書、日中韓の入力システムの全角モードで入力した値には、全角英数字が混ざりやすくなります。
- Webページをコピーすると、
と書かれた NBSP が付いてきます。文末や名前の間によくあります。 - メッセンジャーや SNS のリンクプレビュー、エディターからコピーしたテキストには、ゼロ幅スペースが挟まっていることもあります。
Excel の CLEAN 関数はコード0〜31の制御文字を削除する関数なので、NBSP・ゼロ幅スペース・全角文字は処理しません。シート上で解決できない値は、このツールで整理してから貼り直してください。
隠れた文字を見つける方法
整理する前に、どの行に問題があるかを見たいなら、行フィルター を「含む行だけ残す」と「正規表現」にして、検索する内容に [ !-~] を入れてください。該当する文字が含まれる行だけが残るので、原因となったデータを確認できます。確認が終わったら、このステップはオフにするか削除します。
チェックリスト
- 比較に失敗したら、まず見えない文字を疑う。
- 「見えない文字・引用符の整理」を全角変換より前に置く。
- 日本語・中国語の原稿には、全角変換を部分的にだけ使う。
最終更新: 2026-09-23