我意识到使用带有LinkExtractor规则的CrawlSpider只能解析链接的页面,而不能解析起始页面本身。例如,如果http://mypage.test包含指向http://mypage.test/cats/和http://mypage.test/horses/的链接,爬虫将在不解析http://mypage.test下面是一个简单的代码示例: from scrapy</
尝试让Scrapy抓取多个域。我让它工作了很短时间,但有些东西改变了,我不知道是什么。我的理解是,带有规则的"CrawlSpider“应该遵循任何允许的链接,直到深度设置或域名耗尽。import scrapyfrom scrapy.linkextractors import LinkExtractorimport scrapy
from scrapy.spiders i