开发者社区 问答 正文

scrapy的去重原理是什么?

scrapy的去重原理是什么?

展开
收起
芯在这 2021-12-08 22:58:05 337 分享 版权
1 条回答
写回答
取消 提交回答
  • 对于每一个url的请求,调度器都会根据请求得相关信息加密得到一个指纹信息,并且将指纹信息和set()集合中的指纹信息进行比对,如果set()集合中已经存在这个数据,就不在将这个Request放入队列中。如果set()集合中没有存在这个加密后的数据,就将这个Request对象放入队列中,等待被调度。

    2021-12-08 22:58:19
    赞同 展开评论
问答分类:
问答地址: