Python正则抓取网易新闻的方法示例

作者：郑小蒜9299_941611_G | 2022-01-06 03:19

这篇文章主要介绍了Python正则抓取网易新闻的方法,结合实例形式较为详细的分析了Python使用正则进行网易新闻抓取操作的相关实现技巧与注意事项,需要的朋友可以参考下

本文实例讲述了Python正则抓取网易新闻的方法。分享给大家供大家参考，具体如下：

自己写了些关于抓取网易新闻的爬虫，发现其网页源代码与网页的评论根本就对不上，所以，采用了抓包工具得到了其评论的隐藏地址（每个浏览器都有自己的抓包工具，都可以用来分析网站）

如果仔细观察的话就会发现，有一个特殊的，那么这个就是自己想要的了

然后打开链接就可以找到相关的评论内容了。（下图为第一页内容）

接下来就是代码了(也照着大神的改改写写了)。

#coding=utf-8
import urllib2
import re
import json
import time
class WY():
  def __init__(self):
    self.headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 5.1) AppleWebKit/534.24 (KHTML, like '}
    self.url='http://comment.news.163.com/data/news3_bbs/df/B9IBDHEH000146BE_1.html'
  def getpage(self,page):
    full_url='http://comment.news.163.com/cache/newlist/news3_bbs/B9IBDHEH000146BE_'+str(page)+'.html'
    return full_url
  def gethtml(self,page):
    try:
      req=urllib2.Request(page,None,self.headers)
      response = urllib2.urlopen(req)
      html = response.read()
      return html
    except urllib2.URLError,e:
      if hasattr(e,'reason'):
        print u"连接失败",e.reason
        return None
  #处理字符串
  def Process(self,data,page):
    if page == 1:
      data=data.replace('var replyData=','')
    else:
      data=data.replace('var newPostList=','')
    reg1=re.compile(" \[")
    data=reg1.sub(' ',data)
    reg2=re.compile('<\\\/a>\]')
    data=reg2.sub('',data)
    reg3=re.compile('
')
    data=reg3.sub('',data)
    return data
  #解析json
  def dealJSON(self):
    with open("WY.txt","a") as file:
      file.write('ID'+'|'+'评论'+'|'+'踩'+'|'+'顶'+'\n')
    for i in range(1,12):
      if i == 1:
        data=self.gethtml(self.url)
        data=self.Process(data,i)[:-1]
        value=json.loads(data)
        file=open('WY.txt','a')
        for item in value['hotPosts']:
          try:
            file.write(item['1']['f'].encode('utf-8')+'|')
            file.write(item['1']['b'].encode('utf-8')+'|')
            file.write(item['1']['a'].encode('utf-8')+'|')
            file.write(item['1']['v'].encode('utf-8')+'\n')
          except:
            continue
        file.close()
        print '--正在采集%d/12--'%i
        time.sleep(5)
      else:
        page=self.getpage(i)
        data = self.gethtml(page)
        data = self.Process(data,i)[:-2]
        # print data
        value=json.loads(data)
        # print value
        file=open('WY.txt','a')
        for item in value['newPosts']:
          try:
            file.write(item['1']['f'].encode('utf-8')+'|')
            file.write(item['1']['b'].encode('utf-8')+'|')
            file.write(item['1']['a'].encode('utf-8')+'|')
            file.write(item['1']['v'].encode('utf-8')+'\n')
          except:
            continue
        file.close()
        print '--正在采集%d/12--'%i
        time.sleep(5)
if __name__ == '__main__':
  WY().dealJSON()

以上就是我爬取的代码了。

PS：这里再为大家提供2款非常方便的正则表达式工具供大家参考使用：

JavaScript正则表达式在线测试工具：
http://tools.jb51.net/regex/javascript

正则表达式在线生成工具：
http://tools.jb51.net/regex/create_reg

更多关于Python相关内容可查看本站专题：《Python正则表达式用法总结》、《Python数据结构与算法教程》、《Python Socket编程技巧总结》、《Python函数使用技巧总结》、《Python字符串操作技巧汇总》、《Python入门与进阶经典教程》及《Python文件与目录操作技巧汇总》

希望本文所述对大家Python程序设计有所帮助。

推荐阅读

程序员
为什么MixedGrailsControllerHelper.executeAction()占用了这么多时间？

如何解决《为什么MixedGrailsControllerHelper.executeAction()占用了这么多时间？》经验，为你挑选了0个好方法。 ... [详细]
程序员
MSIL源代码的编译器在哪里驻留在.NET Framework中？

如何解决《MSIL源代码的编译器在哪里驻留在.NETFramework中？》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何覆盖类方法

如何解决《如何覆盖类方法》经验，为你挑选了1个好方法。 ... [详细]
程序员
Codeigniter会话在Live Server上不起作用

如何解决《Codeigniter会话在LiveServer上不起作用》经验，为你挑选了2个好方法。 ... [详细]
程序员
计算年龄JavaScript

如何解决《计算年龄JavaScript》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在Kafka中测试日志压缩是否有效？

如何解决《如何在Kafka中测试日志压缩是否有效？》经验，为你挑选了1个好方法。 ... [详细]
程序员
更新注释视图时如何在自定义注释引脚中执行动画

如何解决《更新注释视图时如何在自定义注释引脚中执行动画》经验，为你挑选了0个好方法。 ... [详细]
程序员
为什么在条件运算符中使用charAt时,我的输出完全不同

如何解决《为什么在条件运算符中使用charAt时,我的输出完全不同》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何处理子类对象属性的__clone

如何解决《如何处理子类对象属性的__clone》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何将枚举转换为QString？

如何解决《如何将枚举转换为QString？》经验，为你挑选了3个好方法。 ... [详细]
程序员
如何在Laravel 5中调用firebase / php-jwt类

如何解决《如何在Laravel5中调用firebase/php-jwt类》经验，为你挑选了0个好方法。 ... [详细]
程序员
如何在linq中跳过并采取工作

如何解决《如何在linq中跳过并采取工作》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在yaml中创建一个未命名的对象数组？

如何解决《如何在yaml中创建一个未命名的对象数组？》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何从Cordova文件传输插件获取mimeType？

如何解决《如何从Cordova文件传输插件获取mimeType？》经验，为你挑选了0个好方法。 ... [详细]
程序员
在单独的文件中使用Sequelize创建模型并在项目中使用它们

如何解决《在单独的文件中使用Sequelize创建模型并在项目中使用它们》经验，为你挑选了1个好方法。 ... [详细]
程序员
动态Facebook Open Graph标签可能吗？

如何解决《动态FacebookOpenGraph标签可能吗？》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在不传递db对象的情况下将Flask模型从app.py中分离出来？

如何解决《如何在不传递db对象的情况下将Flask模型从app.py中分离出来？》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用我创建的时区偏移量初始化一个Moment

如何解决《使用我创建的时区偏移量初始化一个Moment》经验，为你挑选了1个好方法。 ... [详细]
程序员
Maven/Gradle列出编译类

如何解决《Maven/Gradle列出编译类》经验，为你挑选了0个好方法。 ... [详细]
程序员
字符串写在Raspberrypi上的python串口

如何解决《字符串写在Raspberrypi上的python串口》经验，为你挑选了0个好方法。 ... [详细]

郑小蒜9299_941611_G

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章