문서 그라인딩
문서 그라인딩은 의미 있는 데이터를 추출하기 위해 문서를 분석하는 과정입니다. 이 용어는 컴퓨터 해킹과 관련되어 자주 사용되는데, 해커가 기밀 데이터를 드러내기 위해 문서를 "그라인딩"할 수 있기 때문입니다. 그러나 문서 그라인딩은 악의가 없는 목적으로도 사용됩니다. 예를 들면 알려지지 않은 파일 형식을 식별하거나 파일 메타데이터를 확인하는 데 사용됩니다.
일반 텍스트와 바이너리 파일 모두에서 문서 그라인딩을 수행할 수 있습니다.
텍스트 파일
텍스트 파일은 데이터를 일반 텍스트로 저장하므로 이를 그라인딩하는 과정은 간단합니다. grep과 같은 도구나 다른 검색 유틸리티를 사용하면 텍스트 문서에서 문자와 문자열을 검색할 수 있습니다. 텍스트 처리는 비교적 빠른 컴퓨터 작업이므로 몇 개의 대용량 문서를 1초도 안 되는 시간에 그라인딩할 수도 있습니다.
문서 그라인딩의 대상이 되는 일반적인 텍스트 파일 형식에는 로그 파일(.LOG, .TXT)과 구성 파일(.CONF, .CNF)이 있습니다. 예를 들어 해커가 웹 서버에 접근하면 이러한 파일에서 사용자 이름, 암호 및 기타 기밀 데이터를 검색할 수 있습니다.
바이너리 파일
바이너리 파일에는 일반 텍스트가 일부 포함될 수 있지만, 바이너리 데이터인 1과 0도 저장합니다. 바이너리 데이터는 텍스트 검색 도구로 검색할 수 없으므로 그라인딩하기가 더 어렵습니다. 또한 많은 바이너리 파일은 독점적인 파일 형식으로 저장되며, 해당 애플리케이션 없이는 구문 분석하기 어렵습니다. 따라서 바이너리 문서 그라인딩은 일반적으로 일반 텍스트가 포함될 수 있는 문서의 헤더와 푸터에 초점을 맞춥니다. 파일 메타데이터를 추출하는 것도 목적일 수 있습니다.
많은 바이너리 파일은 파일 헤더에 파일 형식에 관한 정보를 포함합니다. 예를 들어 샘플 이미지에서는 헤더의 "PNG"라는 문자가 해당 파일이 PNG 이미지임을 나타냅니다. 이 정보는 파일에 파일 확장자가 없을 때 파일 형식을 식별하는 데 유용합니다. 마찬가지로 디지털 사진에는 사진을 촬영할 때 저장된 숨겨진 EXIF 데이터가 포함된 경우가 많습니다. 이미지 보기 프로그램이나 문서 그라인딩 스크립트가 이 정보를 감지하고 추출할 수 있습니다.
지식 테스트하기