Scraping
Le scraping, ou « scraping web », est le processus d’extraction de grandes quantités d’informations à partir d’un site web. Cela peut consister à télécharger plusieurs pages web ou l’intégralité du site. Le contenu téléchargé peut inclure uniquement le texte des pages, le HTML complet, ou à la fois le HTML et les images de chaque page.
Il existe de nombreuses méthodes différentes pour effectuer le scraping d’un site web. La plus élémentaire consiste à télécharger manuellement des pages web. Cela peut se faire en copiant et en collant le contenu de chaque page dans un éditeur de texte, ou en utilisant la commande de votre navigateur pour enregistrer des copies locales de pages individuelles. Le scraping peut également être effectué automatiquement à l’aide d’un logiciel de scraping web. C’est la méthode la plus courante pour télécharger un grand nombre de pages d’un site web. Dans certains cas, des robots peuvent être utilisés pour scraper un site web à intervalles réguliers.
Le scraping web peut être effectué à plusieurs fins. Par exemple, vous pouvez vouloir archiver une section d’un site web pour y accéder hors ligne. En téléchargeant plusieurs pages sur votre ordinateur, vous pouvez les lire ultérieurement sans être connecté à Internet. Les développeurs web effectuent parfois le scraping de leurs propres sites web lorsqu’ils testent la présence de liens et d’images qui ne fonctionnent pas sur chaque page. Le scraping peut également être effectué à des fins illégales, par exemple pour copier un site web et le republier sous un autre nom. Ce type de scraping est considéré comme une violation des droits d’auteur et peut entraîner des poursuites judiciaires.
NOTE:Bien que scraper un site web dans le but de republier des informations soit toujours incorrect, scraper un site à d’autres fins peut tout de même constituer une violation des conditions d’utilisation du site. Vous devez donc toujours lire les conditions d’utilisation d’un site web avant d’en télécharger le contenu.
Testez vos connaissances