데이터 마이닝
데이터 마이닝은 패턴 및 기타 정보를 찾기 위해 많은 양의 데이터를 분석하는 과정입니다. 일반적으로 구조화된 형식으로 데이터를 저장하는 데이터베이스에서 수행됩니다. 많은 양의 데이터를 "채굴"하면 숨겨진 정보를 발견하여 다른 용도로 사용할 수 있습니다.
데이터 마이닝 예시
신용 카드 회사는 데이터 마이닝을 사용하여 회원의 구매 습관을 더 자세히 알아볼 수 있습니다. 미국 전역의 카드 소유자가 구매한 내역을 분석하면 회사는 연령, 인종, 거주 지역과 같은 다양한 인구 집단의 쇼핑 습관을 발견할 수 있습니다. 이 정보는 개인에게 맞춤형 프로모션을 제공하는 데 유용할 수 있습니다. 같은 데이터에서 미국 내 여러 지역의 쇼핑 패턴이 드러날 수도 있습니다. 이 정보는 특정 주에서 광고를 하거나 사업을 시작하려는 회사에 유용할 수 있습니다.
Google과 Facebook 같은 온라인 서비스는 사용자에게 맞춤형 콘텐츠와 광고를 제공하기 위해 막대한 양의 데이터를 마이닝합니다. 예를 들어 Google은 검색 쿼리를 분석하여 특정 지역에서 인기 있는 검색어를 찾고, 이를 자동 완성 목록(입력할 때 표시되는 추천 항목)의 맨 위로 이동할 수 있습니다. Facebook은 사용자 활동 데이터를 마이닝하여 다양한 연령대에서 인기 있는 주제를 발견하고, 이 정보를 바탕으로 맞춤형 광고를 제공할 수 있습니다.
데이터 마이닝은 마케팅 목적으로 흔히 사용되지만, 그 밖에도 다양한 용도가 있습니다. 예를 들어 의료 회사는 데이터 마이닝을 사용하여 특정 유전자와 질병 사이의 연관성을 발견할 수 있습니다. 기상 회사는 데이터를 마이닝하여 향후 기상 현상을 예측하는 데 도움이 될 수 있는 날씨 패턴을 찾을 수 있습니다. 교통 관리 기관은 자동차 데이터를 마이닝하여 향후 교통량을 예측하고 고속도로와 도로에 적합한 계획을 세울 수 있습니다.
데이터 마이닝 요구 사항
데이터 마이닝에는 두 가지가 필요합니다. 바로 많은 양의 데이터와 높은 컴퓨팅 성능입니다. 데이터가 잘 정리되어 있을수록 유용한 정보를 찾기 위해 데이터를 마이닝하기가 더 쉽습니다. 따라서 데이터 마이닝을 수행하려는 조직은 어떤 데이터를 기록하고 어떻게 저장할지 적극적으로 결정하는 것이 중요합니다. 데이터를 마이닝할 때는 슈퍼컴퓨터와 컴퓨팅 클러스터를 사용하여 페타바이트 단위의 데이터를 처리할 수 있습니다.
지식 테스트하기