爬虫对目标网页爬取的过程可以参考下面黑色文字部分:首先访问初始url,获取其相应内容对相应内容进行解析,提取感兴趣的信息和新的链接将上一步提取到的数据存储,将获取到的链接去重并存储至仓库从url仓库获得一条未爬取过的url,开始新的循环
图片中由黑色文字组成的循环应该很好理解,那么具体到编程上来说,则必须将上面的流程进行抽象,我们可以编写几个元件,每个元件完成一项功能,上图中的蓝底白字就是对这一流程的抽象:
爬虫调度器将要完成整个循环,下面写出python下爬虫调度器的程序:
存储器、下载器、解析器和url管理器!首先,还是来看看下面这张图,URL管理器到底应该具有哪些功能?
领取专属 10元无门槛券
私享最新 技术干货