유니코드
IT 위키
Unicode : 유니코드
세계 각국의 문자를 하나의 통일된 방법으로 표현하기 위해 만든 국제 문자 부호 규약.
- 한 문자를 기본 16비트(2바이트)로 표현한다.
16비트로 최대 65,536자를 코드화할 수 있다.
- 확장 영역까지 합치면 백만 자 이상을 담을 수 있다.
- 한글은 조합형·완성형·옛한글을 모두 표현할 수 있다.
- 앞의 128자리는 ASCII 와 같은 순서로 배치해 호환성을 지켰다.
ASCII 를 32비트로 확장한 것이 아니다. 별도로 설계된 체계이며 기본 단위는 16비트다. 오류 검출이나 교정 기능도 없다. 그것은 해밍 코드나 패리티의 역할이다.
유니코드는 '문자에 번호를 붙인 표' 이고, 그 번호를 바이트로 바꾸는 방식은 따로 있다.
| 방식 | 한 문자의 크기 |
|---|---|
| UTF-8 | 1~4바이트 가변. 영문은 1바이트라 ASCII 와 그대로 호환된다. 웹 표준 |
| UTF-16 | 2바이트 기본, 보조 평면은 4바이트 |
| UTF-32 | 언제나 4바이트 |
- EUC-KR / CP949 : 완성형 한글. 유니코드 이전에 쓰던 국내 표준
- UTF-8 : 한글 한 자가 3바이트다
