◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。
crawlspider 修改 rule 解析后链接
在配置 crawlspider 时,rule 用于指定爬取的页面和解析规则。有时,我们需要对 rule 解析后的链接进行额外的处理,例如修改链接格式。
修改链接的解决方案
要在 crawlspider 中修改 rule 解析后的链接,可以采用以下方法:
在 downloadermiddleware 中定义 process_requests 方法。此方法会在请求发送至爬取网站之前调用,可以对请求进行修改。
在 process_requests 方法中,遍历包括 rule 解析后的所有链接。
对于需要修改的详情页链接,使用正则表达式或 urlparse 库等方法提取匹配的url。
拼接修改后的链接,并使用 return response 替换原始请求。这样,修改后的链接将被用于抓取。
代码示例
以问题中提供的 rules 为例,可以在 downloadermiddleware 中实现以下代码:
from scrapy import signals from scrapy.http import request from urlparse import urljoin class customdownloadermiddleware(object): def process_requests(self, requests, spider): for request in requests: if 'eastmoney' in request.meta['rule']: url = request.url # 匹配详情页url格式并修改 modified_url = urljoin(spider.allowed_domains[0], '/a/' + url.split('/')[-1] + '.html') request = request(modified_url, request.meta) return request
在 settings.py 中启用自定义中间件:
DOWNLOADER_MIDDLEWARES = { 'project.middlewares.CustomDownloaderMiddleware': 543, }
◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。