웹 스크래핑
스크래핑 또는 "웹 스크래핑"은 웹사이트에서 대량의 정보를 추출하는 과정입니다. 여기에는 여러 웹 페이지 또는 사이트 전체를 다운로드하는 작업이 포함될 수 있습니다. 다운로드한 콘텐츠에는 페이지의 텍스트만 포함될 수도 있고, 전체 HTML이 포함될 수도 있으며, 각 페이지의 HTML과 이미지가 모두 포함될 수도 있습니다.
웹사이트를 스크래핑하는 방법은 여러 가지가 있습니다. 가장 기본적인 방법은 웹 페이지를 수동으로 다운로드하는 것입니다. 각 페이지의 콘텐츠를 복사하여 텍스트 편집기에 붙여 넣거나, 브라우저의 명령을 사용하여 개별 페이지의 로컬 복사본을 저장할 수 있습니다. 웹 스크래핑 소프트웨어를 사용하여 스크래핑을 자동으로 수행할 수도 있습니다. 이는 웹사이트에서 많은 수의 페이지를 다운로드할 때 가장 일반적인 방법입니다. 경우에 따라 봇을 사용하여 일정한 간격으로 웹사이트를 스크래핑할 수도 있습니다.
웹 스크래핑은 여러 가지 목적으로 수행할 수 있습니다. 예를 들어 웹사이트의 한 부분을 오프라인으로 이용하기 위해 보관하려 할 수 있습니다. 여러 페이지를 컴퓨터에 다운로드하면 인터넷에 연결하지 않고도 나중에 해당 페이지를 읽을 수 있습니다. 웹 개발자는 각 페이지에서 작동하지 않는 링크와 이미지를 테스트할 때 자체 웹사이트를 스크래핑하기도 합니다. 웹사이트를 복사하여 다른 이름으로 다시 게시하는 것처럼 불법적인 목적으로 스크래핑을 수행할 수도 있습니다. 이러한 유형의 스크래핑은 저작권 침해로 간주되며 법적 처벌을 받을 수 있습니다.
NOTE: 정보를 다시 게시할 목적으로 웹사이트를 스크래핑하는 것은 항상 잘못된 일이지만, 다른 목적으로 사이트를 스크래핑하는 경우에도 해당 웹사이트의 이용 약관을 위반할 수 있습니다. 따라서 사이트에서 콘텐츠를 다운로드하기 전에 항상 웹사이트의 이용 약관을 읽어야 합니다.
지식 테스트하기