蜘蛛
蜘蛛(也称为爬虫或机器人)是搜索引擎用来查找和索引网页的自动化程序。它通过访问页面、分析页面内容并跟踪其中包含的链接来“爬取”万维网。蜘蛛发现的每个新页面都会添加到搜索引擎的索引中,从而帮助扩展和更新可搜索的网络。
当蜘蛛访问一个网页时,通常会遇到指向其他页面的链接。在典型的网站上,大多数链接指向同一网站中的页面(内部链接),而少数链接指向其他网站中的页面(外部链接)。跟踪这些链接可以让蜘蛛在不同网站之间跳转,并继续构建索引。由于链接结构彼此关联,蜘蛛会定期返回已经访问过的页面。重新爬取页面有助于搜索引擎发现新内容、跟踪页面更新情况,并统计有多少其他页面链接到每个页面。
现代搜索引擎使用先进的爬取策略来决定先访问哪些页面、多久返回一次,以及对每个网站爬取到多深。更新频率、网站结构和服务器性能等因素都会影响蜘蛛如何浏览网站。
NOTE:“蜘蛛”一词也可以用作动词,例如:“搜索引擎蜘蛛昨天抓取了我的网站。”[/n]
测试你的知识