python爬虫：随心所欲地爬取百度图片

作者：惬听风吟jyy_802 | 2022-11-24 16:09

百度图片，一个动态网页，怎么才能随心所欲地爬取呢，请看这篇文章！

这里有很多很多的参数，我也不知道具体哪些是可以忽略的，后文就索性全复制下来了，具体看后文。

到这里，能够直接观察到的内容就结束了，接下来，借助代码，帮我们打开另一个世界的大门

冲就完事了！

2、代码分析

首先：把上述中的“其它参数”组在一起。

自己做的话，最好复制自己的“其它参数”。

之后，我们可以先提取一下试试，并且把编码格式改成'utf-8'

 url = 'https://image.baidu.com/search/acjson?'
    param = {
        'tn': 'resultjson_com',
        'logid': ' 7517080705015306512',
        'ipn': 'rj',
        'ct': '201326592',
        'is': '',
        'fp': 'result',
        'queryWord': '彭于晏',
        'cl': '2',
        'lm': '-1',
        'ie': 'utf-8',
        'oe': 'utf-8',
        'adpicid': '',
        'st': '',
        'z': '',
        'ic': '',
        'hd': '',
        'latest': '',
        'copyright': '',
        'word': '彭于晏',
        's': '',
        'se': '',
        'tab': '',
        'width': '',
        'height': '',
        'face': '',
        'istype': '',
        'qc': '',
        'nc': '1',
        'fr': '',
        'expermode': '',
        'force': '',
        'cg': 'star',
        'pn': '30',
        'rn': '30',
        'gsm': '1e',
    }
    # 将编码形式转换为utf-8
    response = requests.get(url=url, headers=header, params=param)
    response.encoding = 'utf-8'
    response = response.text    print(response)

运行结果如下：
看上去挺乱的哈，没事，我们给包装一下！

在上面的基础上加上：

 # 把字符串转换成json数据
    data_s = json.loads(response)
    print(data_s)

运行结果如下：

解决掉上一步，我们会发现，想要的数据都在data里面！

那么就提取吧！

 a = data_s["data"]
    for i in range(len(a)-1):  # -1是为了去掉上面那个空数据
        data = a[i].get("thumbURL", "not exist")
        print(data)

结果如下：
到这里，已经成功90%啦，剩下的就是保存和优化代码了！

3、完整代码

这部分和上面有些许不同，仔细看看就会发现嗷！

# -*- coding: UTF-8 -*-"""
@Author  ：远方的星
@Time   : 2021/2/27 17:49
@CSDN    ：https://blog.csdn.net/qq_44921056
@腾讯云   ： https://cloud.tencent.com/developer/user/8320044
"""import requestsimport jsonimport osimport pprint# 创建一个文件夹path = 'D:/百度图片'if not os.path.exists(path):
    os.mkdir(path)# 导入一个请求头header = {
    'User-Agent':'Mozilla/5.0 (Macintosh; Intel Mac OS X 11_1_0) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/87.0.4280.88 Safari/537.36'}# 用户（自己）输入信息指令keyword = input('请输入你想下载的内容：')page = input('请输入你想爬取的页数：')page = int(page) + 1n = 0pn = 1# pn代表从第几张图片开始获取，百度图片下滑时默认一次性显示30张for m in range(1, page):
    url = 'https://image.baidu.com/search/acjson?'
    param = {
        'tn': 'resultjson_com',
        'logid': ' 7517080705015306512',
        'ipn': 'rj',
        'ct': '201326592',
        'is': '',
        'fp': 'result',
        'queryWord': keyword,
        'cl': '2',
        'lm': '-1',
        'ie': 'utf-8',
        'oe': 'utf-8',
        'adpicid': '',
        'st': '',
        'z': '',
        'ic': '',
        'hd': '',
        'latest': '',
        'copyright': '',
        'word': keyword,
        's': '',
        'se': '',
        'tab': '',
        'width': '',
        'height': '',
        'face': '',
        'istype': '',
        'qc': '',
        'nc': '1',
        'fr': '',
        'expermode': '',
        'force': '',
        'cg': 'star',
        'pn': pn,
        'rn': '30',
        'gsm': '1e',
    }
    # 定义一个空列表，用于存放图片的URL
    image_url = list()
    # 将编码形式转换为utf-8
    response = requests.get(url=url, headers=header, params=param)
    response.encoding = 'utf-8'
    response = response.text    # 把字符串转换成json数据
    data_s = json.loads(response)
    a = data_s["data"]  # 提取data里的数据
    for i in range(len(a)-1):  # 去掉最后一个空数据
        data = a[i].get("thumbURL", "not exist")  # 防止报错key error
        image_url.append(data)

    for image_src in image_url:
        image_data = requests.get(url=image_src, headers=header).content  # 提取图片内容数据
        image_name = '{}'.format(n+1) + '.jpg'  # 图片名
        image_path = path + '/' + image_name  # 图片保存路径
        with open(image_path, 'wb') as f:  # 保存数据
            f.write(image_data)
            print(image_name, '下载成功啦！！！')
            f.close()
        n += 1
    pn += 29

运行结果如下：
②：输入的内容可以很多变：比如桥、月亮、太阳、胡歌、赵丽颖等等。

四、Blogger’s speech

希望大家可以，点赞、关注、收藏，三连支持一下！

大量免费学习推荐，敬请访问python教程(视频)

以上就是python爬虫：随心所欲地爬取百度图片的详细内容，更多请关注其它相关文章！

推荐阅读

程序员
使用FormData和multer上传文件

如何解决《使用FormData和multer上传文件》经验，为你挑选了1个好方法。 ... [详细]
程序员
Guava是否提供了一种解除字符串的方法？

如何解决《Guava是否提供了一种解除字符串的方法？》经验，为你挑选了1个好方法。 ... [详细]
程序员
在列表和数组中按索引获取struct项

如何解决《在列表和数组中按索引获取struct项》经验，为你挑选了0个好方法。 ... [详细]
程序员
如何清除TextBox以使默认的Undo方法仍然起作用？

如何解决《如何清除TextBox以使默认的Undo方法仍然起作用？》经验，为你挑选了1个好方法。 ... [详细]
程序员
jQuery自动完成悬停样式

如何解决《jQuery自动完成悬停样式》经验，为你挑选了3个好方法。 ... [详细]
程序员
如何将相机聚焦在Windows Universal Apps中？

如何解决《如何将相机聚焦在WindowsUniversalApps中？》经验，为你挑选了1个好方法。 ... [详细]
程序员
Javascript中的2D数组

如何解决《Javascript中的2D数组》经验，为你挑选了1个好方法。 ... [详细]
程序员
EC2实例可以拒绝自动终止吗？

如何解决《EC2实例可以拒绝自动终止吗？》经验，为你挑选了0个好方法。 ... [详细]
程序员
ServerSocket无法从客户端读取输入

如何解决《ServerSocket无法从客户端读取输入》经验，为你挑选了1个好方法。 ... [详细]
程序员
添加一个int变量时生成不同的IL

如何解决《添加一个int变量时生成不同的IL》经验，为你挑选了2个好方法。 ... [详细]
程序员
IE11浏览器中的<input type ="file">定位问题

如何解决《IE11浏览器中的<inputtype="file">定位问题》经验，为你挑选了0个好方法。 ... [详细]
程序员
百胜尝试在CentOS 6上安装.el7版本

如何解决《百胜尝试在CentOS6上安装.el7版本》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用C#中的32feet.net库从Windows发送bMessage到消息访问服务器

如何解决《使用C#中的32feet.net库从Windows发送bMessage到消息访问服务器》经验，为你挑选了0个好方法。 ... [详细]
程序员
为什么定义常量表达式的规则必须如此混乱？

如何解决《为什么定义常量表达式的规则必须如此混乱？》经验，为你挑选了0个好方法。 ... [详细]
程序员
单击按钮时如何更改背景颜色

如何解决《单击按钮时如何更改背景颜色》经验，为你挑选了1个好方法。 ... [详细]
程序员
确定我们是否在IPython笔记本会话中

如何解决《确定我们是否在IPython笔记本会话中》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用contenteditable div获取并设置光标位置

如何解决《使用contenteditablediv获取并设置光标位置》经验，为你挑选了1个好方法。 ... [详细]
程序员
将任意类的列转换为另一个data.table中的匹配列的类

如何解决《将任意类的列转换为另一个data.table中的匹配列的类》经验，为你挑选了2个好方法。 ... [详细]
程序员
如何避免Flask-Admin 2.1警告"UserWarning:规则集中缺少字段"？

如何解决《如何避免Flask-Admin2.1警告"UserWarning:规则集中缺少字段"？》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何从逻辑上解释二进制搜索的任何变体

如何解决《如何从逻辑上解释二进制搜索的任何变体》经验，为你挑选了1个好方法。 ... [详细]

惬听风吟jyy_802

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章