网页抓取

网页抓取,也称为“网络爬取”,是从网站中提取大量信息的过程。这可能包括下载多个网页或整个网站。下载的内容可能只包括网页中的文本、完整的HTML,或每个网页中的 HTML 和图像。

抓取网站有许多不同的方法。最基本的方法是手动下载网页。你可以将每个网页中的内容复制并粘贴到文本编辑器中,也可以使用浏览器的 文件 → 另存为… 命令,保存各个网页的本地副本。还可以使用网页抓取软件自动完成抓取。这是从网站下载大量网页最常用的方法。在某些情况下,还可以使用机器人定期抓取网站。

网页抓取可能有多种不同的用途。例如,你可能希望存档网站的某个部分,以便离线访问。通过将多个网页下载到计算机中,你可以稍后阅读这些网页,而无需连接到互联网。网页开发人员有时会抓取自己的网站,以测试每个网页中失效的链接和图像。抓取也可能用于非法目的,例如复制某个网站并以其他名称重新发布。这类抓取被视为侵犯版权,并可能导致法律起诉。

NOTE:以重新发布信息为目的抓取网站始终是不当行为,但出于其他目的抓取网站仍可能违反该网站的使用条款。因此,在从网站下载内容之前,应始终阅读该网站的使用条款。[/n]

更新日期 September 22, 2011 作者 Per C.

quiz测试你的知识

Which of the following is a P2P file sharing protocol?

A
BitTorrent
0%
B
BitLocker
0%
C
Bitwise
0%
D
Bitcoin
0%
Correct! Incorrect!     View the BitTorrent definition.
More Quizzes →

Tech Terms 计算机词典

本页中网页抓取的定义是由 TechTerms.com 的作者撰写的原创定义。如果您想引用本页或引用此定义,请使用定义正下方的绿色引用栏。

我们的目标是以简单易懂的方式解释计算机术语。我们努力使发布的每个定义都做到准确和简明。如果您对本定义有任何反馈,或想建议一个新的技术术语,请联系我们

Tech Terms 通讯

通过我们的每日或每周通讯提升您的技术知识!立即订阅,即可将新术语和测验发送到您的收件箱。

订阅免费的 TechTerms 通讯

您希望多久收到一封电子邮件?

您可以随时使用每封邮件中的链接取消订阅或更改接收频率。 有疑问?请联系我们

注意:通讯以英文发送。