12赞

python爬虫线程池创建并获取文件代码实例

作者：重庆制造漫画社 | 2022-02-22 12:32

这篇文章主要介绍了python爬虫线程池创建并获取文件代码实例,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下

本实例主要进行线程池创建，多线程获取、存储视频文件

梨视频：利用线程池进行视频爬取

#爬取梨视频数据
import requests
import re
from lxml import etree
from multiprocessing.dummy import Pool
import random

# 定义获取视频数据方法
def getVideoData(url): # url为列表中的视频url
  return requests.get(url=url,headers=headers).content

# 定义存储数据方法
def saveVideo(data):
  fileName = str(random.randint(0,5000))+'.mp4'
  with open(fileName,'wb') as fp:
    fp.write(data)

# 爬取数据
#实例化一个线程池对象，开启5个线程池
pool = Pool(5)

url = 'https://www.pearvideo.com/category_1'
headers = {
  'User-Agent':'Mozilla/5.0 (Windows NT 6.1; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/72.0.3626.119 Safari/537.36'
}
page_text = requests.get(url=url,headers=headers).text
tree = etree.HTML(page_text)
li_list = tree.xpath('//div[@id="listvideoList"]/ul/li')

video_url_list = [] # 存的是将要下载视频的url
for li in li_list:
  detail_url = 'https://www.pearvideo.com/'+li.xpath('./div/a/@href')[0]
  detail_page = requests.get(url=detail_url,headers=headers).text
  #因为视频连接不在标签汇中，而是一个js语句，所以用正则匹配
  video_url = re.findall('srcUrl="(.*?)",vdoUrl',detail_page,re.S)[0]
  video_url_list.append(video_url)
  
# map函数的应用：参数1：回调函数，参数2：列表；
#将列表中的参数赋值给回调函数的形参，让回调函数处理
video_data_list = pool.map(getVideoData,video_url_list)

pool.map(saveVideo,video_data_list)

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

推荐阅读

程序员
从文本文件中读取一行会返回不需要的斜杠

如何解决《从文本文件中读取一行会返回不需要的斜杠》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何从C++中的单独线程发布要在Android主线程上运行的代码？

如何解决《如何从C++中的单独线程发布要在Android主线程上运行的代码？》经验，为你挑选了0个好方法。 ... [详细]
程序员
如何使用Firebase的新bolt编译器定义索引

如何解决《如何使用Firebase的新bolt编译器定义索引》经验，为你挑选了1个好方法。 ... [详细]
程序员
将某个JSON值映射到Enum值C#

如何解决《将某个JSON值映射到Enum值C#》经验，为你挑选了1个好方法。 ... [详细]
程序员
PMA 4.5.2.0 file_exists():open_basedir限制生效

如何解决《PMA4.5.2.0file_exists():open_basedir限制生效》经验，为你挑选了1个好方法。 ... [详细]
程序员
Nginx无法将Docker部署到亚马逊

如何解决《Nginx无法将Docker部署到亚马逊》经验，为你挑选了1个好方法。 ... [详细]
程序员
TLS变量上的"非常线程局部引用常规符号"错误

如何解决《TLS变量上的"非常线程局部引用常规符号"错误》经验，为你挑选了0个好方法。 ... [详细]
程序员
使用BouncyCastle和GnuPG 2.1的`pubring.kbx`文件

如何解决《使用BouncyCastle和GnuPG2.1的`pubring.kbx`文件》经验，为你挑选了1个好方法。 ... [详细]
程序员
Null检查Linq中的String.ToLower表达式

如何解决《Null检查Linq中的String.ToLower表达式》经验，为你挑选了2个好方法。 ... [详细]
程序员
控制图例中的行数

如何解决《控制图例中的行数》经验，为你挑选了1个好方法。 ... [详细]
程序员
无法ping泊坞窗容器

如何解决《无法ping泊坞窗容器》经验，为你挑选了0个好方法。 ... [详细]
程序员
如何阻止\关闭字符串

如何解决《如何阻止\关闭字符串》经验，为你挑选了1个好方法。 ... [详细]
程序员
将vanilla对象转换为类？

如何解决《将vanilla对象转换为类？》经验，为你挑选了1个好方法。 ... [详细]
程序员
安装rJava

如何解决《安装rJava》经验，为你挑选了3个好方法。 ... [详细]
程序员
在JavaScript中使用两种方法散列JSON字符串以在URL中使用

如何解决《在JavaScript中使用两种方法散列JSON字符串以在URL中使用》经验，为你挑选了1个好方法。 ... [详细]
程序员
在Spring Data Mongo中设置自定义转换器

如何解决《在SpringDataMongo中设置自定义转换器》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在Windows上为PHP安装PDO驱动程序？

如何解决《如何在Windows上为PHP安装PDO驱动程序？》经验，为你挑选了1个好方法。 ... [详细]
程序员
为什么运行时要构造决策树mnlog(n)？

如何解决《为什么运行时要构造决策树mnlog(n)？》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用Singleton模式的Android Volley错误

如何解决《使用Singleton模式的AndroidVolley错误》经验，为你挑选了1个好方法。 ... [详细]
程序员
有没有办法截断字段数据

如何解决《有没有办法截断字段数据》经验，为你挑选了1个好方法。 ... [详细]

重庆制造漫画社

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章

python爬虫 线程池创建并获取文件代码实例

python爬虫线程池创建并获取文件代码实例