19赞

详解用python写网络爬虫-爬取新浪微博评论

作者：地之南_816 | 2022-01-26 07:47

新浪微博需要登录才能爬取，这里使用m.weibo.cn这个移动端网站即可实现简化操作，用这个访问可以直接得到的微博id。分析新浪微博的评论获取方式得知，其采用动态加载。所以使用json模块解析json代码单独编写了字符优化函数，解决微博评论中的嘈杂干扰字符本函数是用python写网络爬虫的终极目的，

新浪微博需要登录才能爬取，这里使用m.weibo.cn这个移动端网站即可实现简化操作，用这个访问可以直接得到的微博id。

分析新浪微博的评论获取方式得知，其采用动态加载。所以使用json模块解析json代码

单独编写了字符优化函数，解决微博评论中的嘈杂干扰字符

本函数是用python写网络爬虫的终极目的，所以采用函数化方式编写，方便后期优化和添加各种功能

# -*- coding:gbk -*-
import re
import requests
import json
from lxml import html
#测试微博4054483400791767
comments=[]

def get_page(weibo_id):
  url='https://m.weibo.cn/status/{}'.format(weibo_id)
  html=requests.get(url).text
  regcount=r'"comments_count": (.*?),'
  comments_count=re.findall(regcount,html)[-1]
  comments_count_number=int(comments_count)
  page=int(comments_count_number/10)
  return page-1

def opt_comment(comment):
  tree=html.fromstring(comment)
  strcom=tree.xpath('string(.)')
  reg1=r'回复@.*?:'
  reg2=r'回覆@.*?:'
  reg3=r'//@.*'
  newstr=''
  comment1=re.subn(reg1,newstr,strcom)[0]
  comment2=re.subn(reg2,newstr,comment1)[0]
  comment3=re.subn(reg3,newstr,comment2)[0]
  return comment3

def get_responses(id,page):
  url="https://m.weibo.cn/api/comments/show?id={}&page={}".format(id,page)
  response=requests.get(url)
  return response

def get_weibo_comments(response):
  json_response=json.loads(response.text)
  for i in range(0,len(json_response['data'])):
    comment=opt_comment(json_response['data'][i]['text'])
    comments.append(comment)


weibo_id=input("输入微博id，自动返回前5页评论：")
weibo_id=int(weibo_id)
print('\n')
page=get_page(weibo_id)
for page in range(1,page+1):
  response=get_responses(weibo_id,page)
  get_weibo_comments(response)

for com in comments:
  print(com)
print(len(comments))

以上所述是小编给大家介绍的python爬取新浪微博评论详解整合，希望对大家有所帮助，如果大家有任何疑问请给我留言，小编会及时回复大家的。在此也非常感谢大家对网站的支持！

推荐阅读

程序员
什么是iOS中的企业部署节省(XCode 7)

如何解决《什么是iOS中的企业部署节省(XCode7)》经验，为你挑选了1个好方法。 ... [详细]
程序员
为什么DataTable TableTools导出为pdf或excel或csv不能与私有浏览器一起使用？

如何解决《为什么DataTableTableTools导出为pdf或excel或csv不能与私有浏览器一起使用？》经验，为你挑选了1个好方法。 ... [详细]
程序员
获取当前位置0在marshmallow,其中23 API以下,它给出了精确的当前位置使用融合位置

如何解决《获取当前位置0在marshmallow,其中23API以下,它给出了精确的当前位置使用融合位置》经验，为你挑选了2个好方法。 ... [详细]
程序员
如何使用图像Magick将png灰度图像从comand线转换为RGB

如何解决《如何使用图像Magick将png灰度图像从comand线转换为RGB》经验，为你挑选了1个好方法。 ... [详细]
程序员
R：分组表中缺少级别的零填充

如何解决《R：分组表中缺少级别的零填充》经验，为你挑选了1个好方法。 ... [详细]
程序员
Android Studio添加图片

如何解决《AndroidStudio添加图片》经验，为你挑选了1个好方法。 ... [详细]
程序员
当我使用NSCachedURLResponse时,我得到了"301PermMove"

如何解决《当我使用NSCachedURLResponse时,我得到了"301PermMove"》经验，为你挑选了0个好方法。 ... [详细]
程序员
弱自我与弱自我的区别()

如何解决《弱自我与弱自我的区别()》经验，为你挑选了1个好方法。 ... [详细]
程序员
将AWS开发工具包与Web Worker一起使用

如何解决《将AWS开发工具包与WebWorker一起使用》经验，为你挑选了0个好方法。 ... [详细]
程序员
PDFBox的.Java:如何只打印一页PDF而不是完整文档？

如何解决《PDFBox的.Java:如何只打印一页PDF而不是完整文档？》经验，为你挑选了0个好方法。 ... [详细]
程序员
使用Angular.js在一些值之后中断表行

如何解决《使用Angular.js在一些值之后中断表行》经验，为你挑选了0个好方法。 ... [详细]
程序员
空列表和空列表有什么区别？

如何解决《空列表和空列表有什么区别？》经验，为你挑选了1个好方法。 ... [详细]
程序员
perl基础知识 - SHIFT功能如何工作

如何解决《perl基础知识-SHIFT功能如何工作》经验，为你挑选了1个好方法。 ... [详细]
程序员
将Python Pandas数据帧上传到MySQL - InternalError:1366,"不正确的字符串值"

如何解决《将PythonPandas数据帧上传到MySQL-InternalError:1366,"不正确的字符串值"》经验，为你挑选了1个好方法。 ... [详细]
程序员
删除Realm中的列

如何解决《删除Realm中的列》经验，为你挑选了1个好方法。 ... [详细]
程序员
Symfony2-如何在准则2中查询带有条件的左联接

如何解决《Symfony2-如何在准则2中查询带有条件的左联接》经验，为你挑选了1个好方法。 ... [详细]
程序员
处理抽象类和类型参数固有的类

如何解决《处理抽象类和类型参数固有的类》经验，为你挑选了0个好方法。 ... [详细]
程序员
用户下订单时调用函数(实际上是API调用)

如何解决《用户下订单时调用函数(实际上是API调用)》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何以编程方式禁用接近传感器

如何解决《如何以编程方式禁用接近传感器》经验，为你挑选了0个好方法。 ... [详细]
程序员
如何将指针作为迭代器返回？

如何解决《如何将指针作为迭代器返回？》经验，为你挑选了1个好方法。 ... [详细]

地之南_816

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章