인코딩 복구기
깨진 글자 되살리기
파일이나 글을 넣고, 인코딩을 알아보고, 원하는 형식으로 내려받는 법.
넣는 방법
파일을 끌어다 놓거나, 깨진 글을 그대로 붙여넣습니다. 넣는 순간 바이트를 훑어 원래 인코딩을 짐작하고 그 결과를 위쪽에 표시합니다.
무엇을 알아보는가
- BOM: 파일 앞머리의 표식으로 UTF-8 · UTF-16 LE · UTF-16 BE 를 곧바로 가려냅니다.
- UTF-16: 표식이 없어도 널바이트가 촘촘히 섞인 모양으로 알아봅니다. 옛날 SMI 자막이 흔히 이렇습니다.
- UTF-8: 바이트 차례가 규칙에 맞는지 하나하나 따집니다.
- CP949 / EUC-KR: 완성형 한글로 읽히는지 보고, 한글이 나오면 그쪽으로 봅니다.
- Shift_JIS: 일본어 가나가 나오면 그쪽으로 봅니다.
외계어(깨진 글자) 복구
'¾È³çÇϼ¼¿ä' 나 '안녕하세ìš"' 처럼 뜻을 알 수 없는 글자가 되었다면 [복구] 를 누르십시오.
깨짐은 두 갈래로 생깁니다. 원래 UTF-8 이던 것이 Latin-1 로 읽힌 경우와, CP949 이던 것이 그렇게 된 경우입니다. 되돌리는 길도 두 갈래라, 두 가지로 모두 되돌려 본 다음 더 그럴듯한 쪽을 고릅니다 — 한 갈래만 먼저 시도해 성공으로 치면, 다른 갈래의 글이 뜻 없는 한글 덩어리로 '복구' 됩니다.
되돌릴 수 있는 것은 글자가 바뀌었을 뿐 정보는 남아 있는 경우입니다. 이미 물음표(?)나 네모(□)로 바뀌어 저장된 글자는 그 자리에서 정보가 사라진 것이라 되살릴 수 없습니다.
내려받기
- UTF-8: 요즘 기기와 프로그램의 기본입니다. 특별한 이유가 없으면 이쪽입니다.
- UTF-8 (BOM): 엑셀에서 CSV 를 열 때 한글이 깨진다면 이쪽으로 저장하십시오.
- EUC-KR: 옛날 기기나 프로그램이 UTF-8 을 모를 때 씁니다.
- UTF-16 LE: 윈도우 계열 프로그램이 요구하는 경우가 있습니다.
파일은 서버로 올라가지 않습니다. 읽고 고치고 내려받는 일이 모두 브라우저 안에서 끝납니다.