18赞

python爬虫中url管理器去重操作实例

作者：mobiledu2402852357 | 2022-01-05 16:07

在本篇内容里小编给大家整理的是一篇关于python爬虫中url管理器去重操作实例，有需要的朋友们可以参考下。

当我们需要有一批货物需要存放时，最好的方法就是有一个仓库进行保管。我们可以把URL管理器看成一个收集了数据的大仓库，而下载器就是这个仓库货物的搬运者。关于下载器的问题，我们暂且不谈。本篇主要讨论的是在url管理器中，我们遇到重复的数据应该如何识别出来，避免像仓库一样过多的囤积相同的货物。听起来是不是很有意思，下面我们一起进入今天的学习。

URL管理器到底应该具有哪些功能？

URL下载器应该包含两个仓库，分别存放没有爬取过的链接和已经爬取过的链接。
应该有一些函数负责往上述两个仓库里添加链接
应该有一个函数负责从新url仓库中随机取出一条链接以便下载器爬取
URL下载器应该能识别重复的链接，已经爬取过的链接就不需要放进仓库了

如果一个URL管理器能够具有以上4点功能，也算是“麻雀虽小，五脏俱全”了。然而，链接去重这个功能，应该怎么实现？

链接去重是关系爬虫效率的一个比较关键的点，尤其是爬取的数据量极大的时候。在这个简单的例子里，由于数据量较少，我们不需要太过复杂的算法，直接借助于python的set()函数即可，该函数可以生成一个集合对象，其元素不可重复。

根据以上分析，URL管理器的w代码如下：

'''
UrlManager
class UrlManager(object):
  def __init__(self):
    #初始化的时候就生成两个url仓库
    self.new_urls = set()
    self.old_urls = set()
  #判断新url仓库中是否还有没有爬取的url
  def has_new_url(self):
    return len(self.new_urls)
  #从new_url仓库获取一个新的url
  def get_new_url(self):
    return self.new_urls.pop()
  def add_new_url(self, url):  #这个函数后来用不到了……
    '''
    将一条url添加到new_urls仓库中
    parm url: str
    return:
    if url is None:
      return
    #只需要判断old_urls中没有该链接即可，new_urls在添加的时候会自动去重
    if url not in self.old_urls:
      self.new_urls.add(url)
  def add_new_urls(self, urls):
    将多条url添加到new_urls仓库中
    parm url: 可迭代对象
    print "start add_new_urls"
    if urls is None or len(urls) == 0:
    for url in urls:
      self.add_new_url(url)
  def add_old_url(self, url):
    self.old_urls.add(url)
    print "add old url succefully"
  #获取已经爬取过的url的数目
  def old_url_size(self):
    return len(self.old_urls)

尝试过以上代码的小伙伴，已经成功学会用url管理器筛选重复的数据了。相信大家经过今天的学习，已经能够了解url的基本功能和简单的使用。

到此这篇关于python爬虫中url管理器去重操作实例的文章就介绍到这了,更多相关python爬虫中url管理器如何去重内容请搜索以前的文章或继续浏览下面的相关文章希望大家以后多多支持！

推荐阅读

程序员
在混合Java/Kotlin项目中使用Dagger 2的Maven配置

如何解决《在混合Java/Kotlin项目中使用Dagger2的Maven配置》经验，为你挑选了0个好方法。 ... [详细]
程序员
Swift - 无法转换'UITabBarController'类型的值

如何解决《Swift-无法转换'UITabBarController'类型的值》经验，为你挑选了1个好方法。 ... [详细]
程序员
为什么以下C++程序打印'0'而不是'6'？

如何解决《为什么以下C++程序打印'0'而不是'6'？》经验，为你挑选了1个好方法。 ... [详细]
程序员
AWS API Gateway:由于配置错误导致执行失败:输出映射不匹配且未配置默认输出映射

如何解决《AWSAPIGateway:由于配置错误导致执行失败:输出映射不匹配且未配置默认输出映射》经验，为你挑选了2个好方法。 ... [详细]
程序员
Swift:CFArray:将值作为UTF字符串获取

如何解决《Swift:CFArray:将值作为UTF字符串获取》经验，为你挑选了1个好方法。 ... [详细]
程序员
Heroku:运行npm install和gulp build for Django app

如何解决《Heroku:运行npminstall和gulpbuildforDjangoapp》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用Browserify在ES6中使用Bootstrap和jQuery包时出错

如何解决《使用Browserify在ES6中使用Bootstrap和jQuery包时出错》经验，为你挑选了1个好方法。 ... [详细]
程序员
Emgu CV 3 findContours和Vec4i类型的层级参数是否等效？

如何解决《EmguCV3findContours和Vec4i类型的层级参数是否等效？》经验，为你挑选了0个好方法。 ... [详细]
程序员
如何将constexpr作为模板参数传递？

如何解决《如何将constexpr作为模板参数传递？》经验，为你挑选了1个好方法。 ... [详细]
程序员
Android PC上的Android工作室更快吗？

如何解决《AndroidPC上的Android工作室更快吗？》经验，为你挑选了0个好方法。 ... [详细]
程序员
在class属性中引用类名的最佳方法是什么？

如何解决《在class属性中引用类名的最佳方法是什么？》经验，为你挑选了0个好方法。 ... [详细]
程序员
将Android Studio更新为1.5后出现Gradle错误

如何解决《将AndroidStudio更新为1.5后出现Gradle错误》经验，为你挑选了1个好方法。 ... [详细]
程序员
实际上是否可以从构造微积分中删除"Pi"？

如何解决《实际上是否可以从构造微积分中删除"Pi"？》经验，为你挑选了1个好方法。 ... [详细]
程序员
电话号码正则表达式不适用于swift

如何解决《电话号码正则表达式不适用于swift》经验，为你挑选了2个好方法。 ... [详细]
程序员
如何使docker-compose从远程git存储库构建映像？

如何解决《如何使docker-compose从远程git存储库构建映像？》经验，为你挑选了2个好方法。 ... [详细]
程序员
Swift无法找到并读取属性列表(.plist)文件

如何解决《Swift无法找到并读取属性列表(.plist)文件》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用BCrypt和Sequelize Model

如何解决《使用BCrypt和SequelizeModel》经验，为你挑选了3个好方法。 ... [详细]
程序员
UICollectionView的自定义焦点引擎行为

如何解决《UICollectionView的自定义焦点引擎行为》经验，为你挑选了0个好方法。 ... [详细]
程序员
如何禁用导航控制器（Swift）中特定视图控制器的自动旋转？

如何解决《如何禁用导航控制器（Swift）中特定视图控制器的自动旋转？》经验，为你挑选了0个好方法。 ... [详细]
程序员
F#通用函数筛选受歧视联合的列表

如何解决《F#通用函数筛选受歧视联合的列表》经验，为你挑选了1个好方法。 ... [详细]

mobiledu2402852357

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章