python正则爬取某段子网站前20页段子(request库)过程解析

作者：135369一生真爱_890 | 2022-12-26 17:38

这篇文章主要介绍了python正则爬取某段子网站前20页段子(request库)过程解析,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下

首先还是谷歌浏览器抓包对该网站数据进行分析，结果如下：

该网站地址：http://www.budejie.com/text

该网站数据都是通过html页面进行展示，网站url默认为第一页，http://www.budejie.com/text/2为第二页，以此类推

对网站的内容段子所处位置进行分析，发现段子内容都是在一个 a 标签中

坑还是有的，这是我第一次写的正则：

content_list = re.findall(r'(.+?)', html_str)

之后发现竟然匹配到了一些推荐的内容，最后我把正则改变下面这样，发现没有问题了，关于正则的知识这里就不做过多解释了

content_list = re.findall(r'

\s*(.+?)', html_str)

现在要的是爬取前20页的段子并保存到本地，已经知道翻页的规律和匹配内容的正则，就直接可以写代码了

代码如下，整体思路还是和前两排爬虫博客一样，面向对象的写法：

import requests
import re
import json

class NeihanSpider(object):
  """内涵段子，百思不得其姐，正则爬取一页的数据"""
  def __init__(self):
    self.temp_url = 'http://www.budejie.com/text/{}' # 网站地址，给页码留个可替换的{}
    self.headers = {
      'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/75.0.3770.100 Safari/537.36',
    }

  def pass_url(self, url): # 发送请求，获取响应
    print(url)
    response = requests.get(url, headers=self.headers)
    return response.content.decode()

  def get_first_page_content_list(self, html_str): # 提取第一页的数据
    content_list = re.findall(r'\s*(.+?)', html_str) # 非贪婪匹配
    return content_list

  def save_content_list(self, content_list):
    with open('neihan.txt', 'a', encoding='utf-8') as f:
      for content in content_list:
        f.write(json.dumps(content, ensure_ascii=False))
        f.write('\n') # 换行
      print('成功保存一页！')

  def run(self): # 实现主要逻辑
    for i in range(20): # 只爬取前20页数据
      # 1. 构造url
      # 2. 发送请求，获取响应
      html_str = self.pass_url(self.temp_url.format(i+1))
      # 3. 提取数据
      content_list = self.get_first_page_content_list(html_str)
      # 4. 保存
      self.save_content_list(content_list)

if __name__ == '__main__':
  neihan = NeihanSpider()
  neihan.run()

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

推荐阅读

程序员
无法获取配置文件(google-services.json)

如何解决《无法获取配置文件(google-services.json)》经验，为你挑选了1个好方法。 ... [详细]
程序员
用redis水平缩放socket.io

如何解决《用redis水平缩放socket.io》经验，为你挑选了0个好方法。 ... [详细]
程序员
Spyder无法在Windows 10上的Anaconda虚拟环境中运行

如何解决《Spyder无法在Windows10上的Anaconda虚拟环境中运行》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何以编程方式禁用Windows 10平板电脑屏幕的边缘滑动手势？

如何解决《如何以编程方式禁用Windows10平板电脑屏幕的边缘滑动手势？》经验，为你挑选了1个好方法。 ... [详细]
程序员
更改导航条目项目语言

如何解决《更改导航条目项目语言》经验，为你挑选了0个好方法。 ... [详细]
程序员
Samsung S Health是独家三星API还是使用Google Fit？

如何解决《SamsungSHealth是独家三星API还是使用GoogleFit？》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在javascript中字符串的每个单词的首字母大写？

如何解决《如何在javascript中字符串的每个单词的首字母大写？》经验，为你挑选了0个好方法。 ... [详细]
程序员
'function'对象没有属性'as_view'

如何解决《'function'对象没有属性'as_view'》经验，为你挑选了2个好方法。 ... [详细]
程序员
R中的OR表达式

如何解决《R中的OR表达式》经验，为你挑选了0个好方法。 ... [详细]
程序员
Android Realm大文件大小

如何解决《AndroidRealm大文件大小》经验，为你挑选了1个好方法。 ... [详细]
程序员
为什么我不能在Haskell中的连接函数(++)上进行模式匹配？

如何解决《为什么我不能在Haskell中的连接函数(++)上进行模式匹配？》经验，为你挑选了2个好方法。 ... [详细]
程序员
Selenium Grid +转发新会话时出错，VM空池用于设置功能

如何解决《SeleniumGrid+转发新会话时出错，VM空池用于设置功能》经验，为你挑选了0个好方法。 ... [详细]
程序员
Flask-restful API授权.访问装饰器内的current_identity

如何解决《Flask-restfulAPI授权.访问装饰器内的current_identity》经验，为你挑选了2个好方法。 ... [详细]
程序员
如何在Anko DSL中引用其他视图？

如何解决《如何在AnkoDSL中引用其他视图？》经验，为你挑选了1个好方法。 ... [详细]
程序员
没有从Prestashop 1.6.1.1网站收到管理员订单确认电子邮件

如何解决《没有从Prestashop1.6.1.1网站收到管理员订单确认电子邮件》经验，为你挑选了1个好方法。 ... [详细]
程序员
Python 3中的整数除法 - 带有负数的奇怪结果

如何解决《Python3中的整数除法-带有负数的奇怪结果》经验，为你挑选了2个好方法。 ... [详细]
程序员
使用preparedStatement.setDate查询MySQL数据库

如何解决《使用preparedStatement.setDate查询MySQL数据库》经验，为你挑选了0个好方法。 ... [详细]
程序员
Mongodb数组$ push和$ pull

如何解决《Mongodb数组$push和$pull》经验，为你挑选了1个好方法。 ... [详细]
程序员
删除android中的标记

如何解决《删除android中的标记》经验，为你挑选了1个好方法。 ... [详细]
程序员
在UITesting Xcode 7中获取表的每个部分中的行数

如何解决《在UITestingXcode7中获取表的每个部分中的行数》经验，为你挑选了1个好方法。 ... [详细]

135369一生真爱_890

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章

DevBox开发工具箱 | 专业的在线开发工具网站