문자 인코딩
우리는 텍스트 문서를 텍스트 줄로 보지만, 컴퓨터는 실제로 이를 이진 데이터, 즉 1과 0의 연속으로 인식합니다. 따라서 텍스트 문서 안의 문자는 숫자 코드로 표현해야 합니다. 이를 위해 텍스트는 여러 문자 인코딩 유형 중 하나를 사용해 저장됩니다.
가장 널리 사용되는 문자 인코딩 유형은 ASCII와 유니코드입니다. ASCII는 여전히 거의 모든 텍스트 편집기에서 지원되지만, 더 많은 문자 집합을 지원하는 유니코드가 더 일반적으로 사용됩니다. 유니코드는 흔히 UTF-8, UTF-16 또는 UTF-32로 정의되며, 이는 서로 다른 유니코드 표준을 의미합니다. UTF는 "Unicode Transformation Format"의 약자이며, 숫자는 각 문자를 표현하는 데 사용되는 비트 수를 나타냅니다. 컴퓨팅 초기부터 문자는 최소 하나의 바이트(8비트)로 표현되어 왔습니다. 따라서 서로 다른 유니코드 표준은 문자를 8비트의 배수로 저장합니다.
ASCII와 유니코드가 가장 일반적인 문자 인코딩 유형이지만, 텍스트 파일을 인코딩하는 데 다른 인코딩 표준을 사용할 수도 있습니다. 예를 들어 서유럽, 라틴-미국, 일본어, 한국어, 중국어용 문자 인코딩 표준과 같은 여러 언어별 문자 인코딩 표준이 있습니다. 서양 언어는 비슷한 문자를 사용하지만, 동양 언어는 완전히 다른 문자 집합이 필요합니다. 따라서 라틴 인코딩은 중국어로 된 텍스트 문자열을 표현하는 데 필요한 기호를 지원하지 않습니다. 다행히 UTF-16과 같은 최신 표준은 서양과 동양의 문자 및 기호를 모두 표현할 수 있을 만큼 큰 문자 집합을 지원합니다.
지식 테스트하기