11赞

python爬虫开发之使用python爬虫库requests，urllib与今日头条搜索功能爬取搜索内容实例

作者：k78283381 | 2021-12-11 19:41

这篇文章主要介绍了python爬虫开发之使用python爬虫库requests，urllib与今日头条搜索功能爬取搜索内容实例,需要的朋友可以参考下

使用python爬虫库requests，urllib爬取今日头条街拍美图

代码均有注释

import re,json,requests,os
from hashlib import md5
from urllib.parse import urlencode
from requests.exceptions import RequestException
from bs4 import BeautifulSoup
from multiprocessing import Pool
#请求索引页
def get_page_index(offset,keyword):
  #传送的数据
  data={
    'offset': offset,
    'format': 'json',
    'keyword': keyword,
    'autoload': 'true',
    'count': '20',
    'cur_tab': 1
  }
  #自动编码为服务器可识别的url
  url="https://www.toutiao.com/search_content/?"+urlencode(data)
  #异常处理
  try:
    #获取返回的网页
    response=requests.get(url)
    #判断网页的状态码是否正常获取
    if response.status_code==200:
      #返回解码后的网页
      return response.text
    #不正常获取，返回None
    return None
  except RequestException:
    #提示信息
    print("请求索引页出错")
    return None
#解析请求的索引网页数据
def parse_page_index(html):
  #json加载转换
  data=json.loads(html)
  #数据为真，并且data键值存在与数据中
  if data and 'data' in data.keys():
    #遍历返回图集所在的url
    for item in data.get('data'):
      yield item.get('article_url')
#图集详情页请求
def get_page_detail(url):
  #设置UA，模拟浏览器正常访问
  head = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}
  #异常处理
  try:
    response=requests.get(url,headers=head)
    if response.status_code==200:
      return response.text
    return None
  except RequestException:
    print("请求详情页出错")
    return None
#解析图集详情页的数据
def parse_page_detail(html,url):
  #异常处理
  try:
    #格式转换与图集标题提取
    soup=BeautifulSoup(html,'lxml')
    title=soup.select('title')[0].get_text()
    print(title)
    #正则查找图集链接
    image_pattern = re.compile('gallery: (.*?),\n', re.S)
    result = re.search(image_pattern, html)
    if result:
      #数据的优化
      result=result.group(1)
      result = result[12:]
      result = result[:-2]
      #替换
      result = re.sub(r'\\', '', result)
      #json加载
      data = json.loads(result)
      #判断数据不为空，并确保sub——images在其中
      if data and 'sub_images' in data.keys():
        #sub_images数据提取
        sub_images=data.get('sub_images')
        #列表数据提取
        images=[item.get('url') for item in sub_images]
        #图片下载
        for image in images:download_images(image)
        #返回字典
        return {
          'title':title,
          'url':url,
          'images':images
        }
  except Exception:
    pass
#图片url请求
def download_images(url):
  #提示信息
  print('正在下载',url)
  #浏览器模拟
  head = {
    'User-Agent': 'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36'}
  #异常处理
  try:
    response = requests.get(url, headers=head)
    if response.status_code == 200:
      #图片保存
      save_image(response.content)
    return None
  except RequestException:
    print("请求图片出错")
    return None
#图片保存
def save_image(content):
  #判断文件夹是否存在，不存在则创建
  if '街拍' not in os.listdir():
    os.makedirs('街拍')
  #设置写入文件所在文件夹位置
  os.chdir('E:\python写网路爬虫\CSDN爬虫学习\街拍')
  #路径，名称，后缀
  file_path='{0}/{1}.{2}'.format(os.getcwd(),md5(content).hexdigest(),'jpg')
  #图片保存
  with open(file_path,'wb') as f:
      f.write(content)
      f.close()
#主函数
def mian(offset):
  #网页获取
  html=get_page_index(offset,'街拍')
  #图集url
  for url in parse_page_index(html):
    if url!=None:
      #图集网页详情
      html=get_page_detail(url)
      #图集内容
      result=parse_page_detail(html,url)
if __name__ == '__main__':
  #创建访问的列表（0-9）页
  group=[i*10 for i in range(10)]
  #创建多线程进程池
  pool=Pool()
  #进程池启动，传入的数据
  pool.map(mian,group)

爬取图片如下

本文主要讲解了python爬虫库requests、urllib与OS模块结合使用爬取今日头条搜索内容的实例，更多关于python爬虫相关知识请查看下面的相关链接

推荐阅读

程序员
Azure Continuous Deploy with Debug配置

如何解决《AzureContinuousDeploywithDebug配置》经验，为你挑选了1个好方法。 ... [详细]
程序员
Kotlin在android.support.v4.app.Fragment null对象引用中直接访问Button

如何解决《Kotlin在android.support.v4.app.Fragmentnull对象引用中直接访问Button》经验，为你挑选了1个好方法。 ... [详细]
程序员
html范围滑块 - oninput在IE 11中不起作用

如何解决《html范围滑块-oninput在IE11中不起作用》经验，为你挑选了0个好方法。 ... [详细]
程序员
检查接口{}的相等性

如何解决《检查接口{}的相等性》经验，为你挑选了1个好方法。 ... [详细]
程序员
删除字符串中整数的括号

如何解决《删除字符串中整数的括号》经验，为你挑选了1个好方法。 ... [详细]
程序员
作为嵌入式服务器运行时Jetty自定义错误页面

如何解决《作为嵌入式服务器运行时Jetty自定义错误页面》经验，为你挑选了1个好方法。 ... [详细]
程序员
有没有办法像默认出口一样使用ES6正常出口？

如何解决《有没有办法像默认出口一样使用ES6正常出口？》经验，为你挑选了1个好方法。 ... [详细]
程序员
IntelliJ无法解析build.sbt中的符号

如何解决《IntelliJ无法解析build.sbt中的符号》经验，为你挑选了1个好方法。 ... [详细]
程序员
计算字典列表中的公共键值对

如何解决《计算字典列表中的公共键值对》经验，为你挑选了1个好方法。 ... [详细]
程序员
在Google Apps脚本中从服务器到客户端进行通信

如何解决《在GoogleApps脚本中从服务器到客户端进行通信》经验，为你挑选了1个好方法。 ... [详细]
程序员
Apache POI性能

如何解决《ApachePOI性能》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在没有eval的情况下解除列表/元组的字符串

如何解决《如何在没有eval的情况下解除列表/元组的字符串》经验，为你挑选了1个好方法。 ... [详细]
程序员
针对具有单个端点的多个响应的RESTful设计

如何解决《针对具有单个端点的多个响应的RESTful设计》经验，为你挑选了1个好方法。 ... [详细]
程序员
从列表python中的某个东西开始删除后面的字符串

如何解决《从列表python中的某个东西开始删除后面的字符串》经验，为你挑选了1个好方法。 ... [详细]
程序员
无法访问docker容器

如何解决《无法访问docker容器》经验，为你挑选了1个好方法。 ... [详细]
程序员
Excel VBA“自动化错误：调用的对象已与其客户端断开连接”

如何解决《ExcelVBA“自动化错误：调用的对象已与其客户端断开连接”》经验，为你挑选了1个好方法。 ... [详细]
程序员
ERR_CONNECTION_REFUSED http:// localhost:3000/socket.io/socket.io.js

如何解决《ERR_CONNECTION_REFUSEDhttp://localhost:3000/socket.io/socket.io.js》经验，为你挑选了1个好方法。 ... [详细]
程序员
Python RandomForest - 未知标签错误

如何解决《PythonRandomForest-未知标签错误》经验，为你挑选了2个好方法。 ... [详细]
程序员
将for(;;)循环转换为foreach

如何解决《将for(;;)循环转换为foreach》经验，为你挑选了1个好方法。 ... [详细]
程序员
RxJs:如何基于observable的状态循环？

如何解决《RxJs:如何基于observable的状态循环？》经验，为你挑选了2个好方法。 ... [详细]

k78283381

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章