Python3直接爬取图片URL并保存示例

作者：手机用户2502851955 | 2022-02-22 11:48

今天小编就为大家分享一篇Python3直接爬取图片URL并保存示例，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧

有时候我们会需要从网络上爬取一些图片，来满足我们形形色色直至不可描述的需求。

一个典型的简单爬虫项目步骤包括两步：获取网页地址和提取保存数据。

这里是一个简单的从图片url收集图片的例子，可以成为一个小小的开始。

获取地址

这些图片的URL可能是连续变化的，如从001递增到099，这种情况可以在程序中将共同的前面部分截取，再在最后递增并字符串化后循环即可。

抑或是它们的URL都保存在某个文件中，这时可以读取到列表中：

def getUrls(path):
  urls = []
  with open(path,'r') as f:
    for line in f:
      urls.append(line.strip('\n'))
  return(urls)

保存图片

在python3中，urllib提供了一系列用于操作URL的功能，其中的request模块可以非常方便地抓取URL内容，也就是发送一个GET请求到指定的页面，然后返回HTTP的响应。具体细节请看注释：

def requestImg(url, name, num_retries=3):
  img_src = url
  # print(img_src)
  header = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) \
    AppleWebKit/537.36 (KHTML, like Gecko) \
      Chrome/35.0.1916.114 Safari/537.36',
    'Cookie': 'AspxAutoDetectCookieSupport=1'
  }
  # Request类可以使用给定的header访问URL
  req = urllib.request.Request(url=img_src, headers=header) 
  try:
    response = urllib.request.urlopen(req) # 得到访问的网址
    filename = name + '.jpg'
    with open(filename, "wb") as f:
      content = response.read() # 获得图片
      f.write(content) # 保存图片
      response.close()
  except HTTPError as e: # HTTP响应异常处理
    print(e.reason)
  except URLError as e: # 一定要放到HTTPError之后，因为它包含了前者
    print(e.reason)
  except IncompleteRead or RemoteDisconnected as e: 
    if num_retries == 0: # 重连机制
      return
    else:
      requestImg(url, name, num_retries-1)

其他

捕获异常

以下是批量爬取网页时可能需要捕获的异常，同时可以看出，urllib2库对应urllib库，而httplib库对应http.client：

Python2	Pyhton3
urllib2.HTTPError	urllib.error.HTTPError
urllib2.URLError	urllib.error.URLError (HTTPError被包含其中)
httplib.IncompleteRead	http.client.IncompleteRead
httplib.RemoteDisconnected	http.client.RemoteDisconnected

重连机制

在函数参数中设置一个参数num_retries并对其进行初始化，即默认参数。在某些异常出现时可以将该参数递减，再让它递归调用自身，这就是基本的重连机制。

修饰器

有种设计模式叫修饰器模式，它可以在不修改目标函数代码的前提下，在目标函数执行前后增加一些额外功能。

def clock(func): # 修饰器函数，对函数计时
  def clocked(*args):
    t0 = timeit.default_timer()
    result = func(*args)
    elapsed = timeit.default_timer() - t0
    name = func.__name__
    arg_str = ', '.join(repr(arg) for arg in args)
    print('[%0.8fs] %s(%s)' % (elapsed, name, arg_str))
    # print('%s(%s) -> %r [%0.8fs]' % (name, arg_str, result, elapsed))
    return result
  return clocked

上面这段代码是修饰器函数的一个例子，用来对函数运行时间进行计时，在需要计时的函数上一行添加一点点代码即可：

@clock

完整代码

from urllib.error import HTTPError, URLError
from http.client import IncompleteRead, RemoteDisconnected
import timeit, time
import urllib.request
import socket
 
 
# timeout = 20
# socket.setdefaulttimeout(timeout) # 等待，防止被简单地反爬
 
 
def getUrls(path):
  urls = []
  with open(path,'r') as f:
    for line in f:
      urls.append(line.strip('\n'))
  return(urls)
 
 
def clock(func): # 修饰器函数，对函数计时
  def clocked(*args):
    t0 = timeit.default_timer()
    result = func(*args)
    elapsed = timeit.default_timer() - t0
    name = func.__name__
    arg_str = ', '.join(repr(arg) for arg in args)
    print('[%0.8fs] %s(%s)' % (elapsed, name, arg_str))
    # print('%s(%s) -> %r [%0.8fs]' % (name, arg_str, result, elapsed))
    return result
  return clocked
 
 
@clock
def requestImg(url, name, num_retries=3):
  img_src = url
  # print(img_src)
  header = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) \
    AppleWebKit/537.36 (KHTML, like Gecko) \
      Chrome/35.0.1916.114 Safari/537.36',
    'Cookie': 'AspxAutoDetectCookieSupport=1'
  }
  req = urllib.request.Request(url=img_src, headers=header)
  try:
    response = urllib.request.urlopen(req)
    filename = name + '.jpg'
    with open(filename, "wb") as f:
      content = response.read()
      f.write(content)
      response.close()
  except HTTPError as e:
    print(e.reason)
  except URLError as e:
    print(e.reason)
  except IncompleteRead or RemoteDisconnected as e:
    if num_retries == 0:
      return
    else:
      requestImg(url, name, num_retries-1)
 
 
 
if __name__ =='__main__':
  urls = getUrls('./'URLS.txt') # 换成你的URL文件路径
  nLines = len(urls)
  print(nLines)
  for index, value in enumerate(urls):
      requestImg(value, './'+str(index).zfill(6)) # zfill用来格式化数字：000001

以上这篇Python3直接爬取图片URL并保存示例就是小编分享给大家的全部内容了，希望能给大家一个参考，也希望大家多多支持。

推荐阅读

程序员
在Cygwin中从源代码构建htop

如何解决《在Cygwin中从源代码构建htop》经验，为你挑选了1个好方法。 ... [详细]
程序员
下面的变量声明是否会导致词法错误或语法错误？

如何解决《下面的变量声明是否会导致词法错误或语法错误？》经验，为你挑选了3个好方法。 ... [详细]
程序员
GetCPUDescriptorHandleForHeapStart堆栈损坏

如何解决《GetCPUDescriptorHandleForHeapStart堆栈损坏》经验，为你挑选了1个好方法。 ... [详细]
程序员
通过文件输入更改背景图像

如何解决《通过文件输入更改背景图像》经验，为你挑选了1个好方法。 ... [详细]
程序员
CORS请求做出反应

如何解决《CORS请求做出反应》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用JavaScript获取元素的样式

如何解决《使用JavaScript获取元素的样式》经验，为你挑选了1个好方法。 ... [详细]
程序员
删除查询在SQL Server中不起作用

如何解决《删除查询在SQLServer中不起作用》经验，为你挑选了1个好方法。 ... [详细]
程序员
模块化pow（）中的负功率

如何解决《模块化pow（）中的负功率》经验，为你挑选了1个好方法。 ... [详细]
程序员
angular指令控制器"this"返回undefined

如何解决《angular指令控制器"this"返回undefined》经验，为你挑选了1个好方法。 ... [详细]
程序员
面向初学者的C ++非阻塞编程

如何解决《面向初学者的C++非阻塞编程》经验，为你挑选了1个好方法。 ... [详细]
程序员
为std :: function键入别名

如何解决《为std::function键入别名》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在Delphi中获得TEdit的画布？

如何解决《如何在Delphi中获得TEdit的画布？》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在java中初始化日期类型的变量？

如何解决《如何在java中初始化日期类型的变量？》经验，为你挑选了2个好方法。 ... [详细]
程序员
Intellij IDEA内置检测代码与checkstyle,PMD和findbugs

如何解决《IntellijIDEA内置检测代码与checkstyle,PMD和findbugs》经验，为你挑选了1个好方法。 ... [详细]
程序员
Apache Phoenix的列族

如何解决《ApachePhoenix的列族》经验，为你挑选了1个好方法。 ... [详细]
程序员
什么是影子根

如何解决《什么是影子根》经验，为你挑选了2个好方法。 ... [详细]
程序员
Angular2.0在子目录中,SystemJS无法导入角度组件

如何解决《Angular2.0在子目录中,SystemJS无法导入角度组件》经验，为你挑选了0个好方法。 ... [详细]
程序员
如何使用Dropwizard接受自定义命令行参数

如何解决《如何使用Dropwizard接受自定义命令行参数》经验，为你挑选了1个好方法。 ... [详细]
程序员
java.net.InetAddress java类不解析Alpine Docker容器上的IP

如何解决《java.net.InetAddressjava类不解析AlpineDocker容器上的IP》经验，为你挑选了1个好方法。 ... [详细]
程序员
Android Studio中的动态ListView:选择随机元素和更新列表视图

如何解决《AndroidStudio中的动态ListView:选择随机元素和更新列表视图》经验，为你挑选了0个好方法。 ... [详细]

手机用户2502851955

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章