UTF-8
Unicode系の文字コード
- 特徴
- 幅広い文字を扱え、現在のWebや多くのシステムで広く使われています。
- 絵文字など
- 多くの文字を扱えます。
- 注意点
- BOMの有無によって、読み込み側の文字コード判定が変わる場合があります。
encoding
UTF-8とShift_JIS(Windows-31J / CP932)を相互変換します。変換できない文字を事前に確認でき、ファイル内容はブラウザ内で処理します。
入力内容は原則としてこのブラウザ内で処理します。ファイル内容や貼り付けたデータをTool Koboのサーバーへ送信しません。
Encoding
ブラウザ内で処理 / サーバー送信なし
または、UTF-8のテキストを直接貼り付け
Use cases
How to use
Tips
文字コードは、文字をファイル内のバイト列として保存するためのルールです。同じ文字でも、UTF-8とShift_JISでは保存されるバイトが異なります。読み込む側が別の文字コードとして解釈すると、文字化けの原因になります。
UTF-8
Unicode系の文字コード
Shift_JIS
Windows-31J / CP932互換
UTF-8で扱える文字のすべてをShift_JIS(Windows-31J)で表現できるわけではありません。一部の絵文字や新しい漢字などは、そのまま変換できません。
また、Shift_JISへ変換できても、UTF-8へ戻したときに別のUnicode文字になる組み合わせがあります。このツールでは、そのような文字も警告対象として表示します。
警告が表示された場合は、文字・Unicodeコードポイント・出現回数を確認してから変換してください。
UTF-8 BOMは、ファイルの先頭に付ける3バイトの目印です。UTF-8では必須ではありませんが、一部のソフトがUTF-8だと判定するための手掛かりとして利用します。
Shift_JISからUTF-8へ変換するときは、読み込み先の仕様に合わせてBOMを付けるか選択できます。仕様が決まっている場合は、その指定を優先してください。
Specification
UTF-8とShift_JIS(Windows-31J / CP932互換)の相互変換に対応します。CSVの列構造そのものは変更せず、文字コードだけを変換します。CRLF、LF、CRなどの改行文字も、文字内容としてそのまま保持します。
ファイル内容はブラウザ内で処理され、変換のためにサーバーへ送信しません。大きなファイルではブラウザのメモリを使用するため、端末の性能によって処理時間が変わることがあります。
FAQ
完全に同じ規格ではありません。このツールでは、日本のWindowsや業務システムで一般的なCP932拡張を含む文字セットを「Shift_JIS(Windows-31J / CP932)」として扱います。
変換先のファイルに文字が正しく入っていても、開くソフトがCP932拡張文字に対応していないと正しく表示できません。CP932、Windows-31J、MS932、SJIS-winなどの文字コード指定が利用できる場合は、そちらを選んでください。
文字コード判定は推測なので100%ではありません。選択した入力文字コードと判定結果が違う場合は、元ファイルの仕様を確認してから変換してください。
元データを修正できるなら、先に修正する方法を推奨します。そのまま続けると、該当文字が別の文字へ置き換わる可能性があります。
はい。CSV・TSVのほか、一般的なテキストファイルにも使えます。ファイルの内容自体は加工せず、文字コードだけを変換します。