2赞

Python实现可获取网易页面所有文本信息的网易网络爬虫功能示例

作者：雨天是最美 | 2022-01-06 02:14

这篇文章主要介绍了Python实现可获取网易页面所有文本信息的网易网络爬虫功能,涉及Python针对网页的获取、字符串正则判定等相关操作技巧,需要的朋友可以参考下

本文实例讲述了Python实现可获取网易页面所有文本信息的网易网络爬虫功能。分享给大家供大家参考，具体如下：

#coding=utf-8
#---------------------------------------
#  程序：网易爬虫
#  作者：ewang
#  日期：2016-7-6
#  语言：Python 2.7
#  功能：获取网易页面中的文本信息并保存到TXT文件中。
#---------------------------------------
import string
import urllib2
import re
import os
class WangYi_Spider:
  #申明相关属性
  def __init__(self):
    #给wangyiUrl属性赋值
    self.wangyiUrl="http://www.163.com/"
    #用来保存页面中文字信息
    self.pageinfor=[]
    print u'已经启动网易爬虫，爬爬...'
  #初始化加载页面并将其转码存储
  def wangyi(self):
    #读取页面的原始信息并将其从gbk转码
    Page=urllib2.urlopen(self.wangyiUrl).read().decode('gbk')
    #获取页面标题
    title=self.find_title(Page)
    print u'网页名称:'+title
    #获取页面中文本信息
    self.save_infor(title)
  #查找页面标题
  def find_title(self,page):
    #匹配xxxx
    myTitle=re.search(r'(.*?)',page,re.S)
    #初始化标题名为暂无标题
    title=u'暂无标题'
    #如果标题存在把标题赋值给title
    if myTitle:
      #(.*?)这称作一个group，组是从1开始
      title=myTitle.group(1)
    else:
      print u'爬虫报告：无法加载网页标题...'
    return title
  #保存页面信息
  def save_infor(self,title):
    #加载页面文本信息到数组中
    self.get_infor()
    #创建并打开本地文件
    f=open(title+'.txt','w+')
    #把获取的页面信息写入文件中
    f.writelines(self.pageinfor)
    #关闭打开的文件
    f.close()
    print u'爬虫报告：文件'+title+'.txt'+u'已经下载:'+os.getcwd()
    print u'按任意键退出...'
    raw_input()
  #获取页面源码并将其存储到数组中
  def get_infor(self):
    #获取页面中的源码
    page=urllib2.urlopen(self.wangyiUrl).read()
    #把页面中的内容gbk解码然后获取页面中所有的文本信息
    self.deal_infor(page.decode('gbk'))
  #从页面代码中获取所需文信息
  def deal_infor(self,page):
    #获取XXX的文本信息XXX
    emTagItems=re.findall("(\W+?)",page,re.S)
    #获取XXXX的文本信息XXXX
    spanTagItems=re.findall("(\W+?)",page,re.S)
    #获取XXXX的文本信息XXXX
    aTagItems=re.findall("(\W+?)",page,re.S)
    #把em tag中获取的文本信息添加到数组pageinfor中
    for emItem in emTagItems:
      #对获取的文本信息用gbk进行编码
      self.pageinfor.append(emItem.encode('gbk')+'\n')
    #把span tag中获取的文本信息添加到数组pageinfor中
    for spanItem in spanTagItems:
      #对获取的文本信息用gbk进行编码
      self.pageinfor.append(spanItem.encode('gbk')+'\n')
    #把a tag中获取的文本信息添加到数组pageinfor中
    for aItem in aTagItems:
      #对获取的文本信息用gbk进行编码
      self.pageinfor.append(aItem.encode('gbk')+'\n')
#------------程序入口处----------------
print u"""#---------------------------------------
#  程序：网易爬虫
#  作者：ewang
#  日期：2016-7-6
#  语言：Python 2.7
#  功能：获取网易页面中的文本信息并保存到TXT文件中
#--------------------------------------------------
"""
wangyiSpider=WangYi_Spider()
wangyiSpider.wangyi()

更多关于Python相关内容可查看本站专题：《Python Socket编程技巧总结》、《Python正则表达式用法总结》、《Python数据结构与算法教程》、《Python函数使用技巧总结》、《Python字符串操作技巧汇总》、《Python入门与进阶经典教程》及《Python文件与目录操作技巧汇总》

希望本文所述对大家Python程序设计有所帮助。

推荐阅读

程序员
Haskell将(0/0)设置为qnan

如何解决《Haskell将(0/0)设置为qnan》经验，为你挑选了1个好方法。 ... [详细]
程序员
Webpack Sass导入URL解析

如何解决《WebpackSass导入URL解析》经验，为你挑选了1个好方法。 ... [详细]
程序员
Matlab:什么更快？是否预先定义了有用的对象？

如何解决《Matlab:什么更快？是否预先定义了有用的对象？》经验，为你挑选了1个好方法。 ... [详细]
程序员
浮动和块级元素

如何解决《浮动和块级元素》经验，为你挑选了1个好方法。 ... [详细]
程序员
棉花糖不会出错

如何解决《棉花糖不会出错》经验，为你挑选了1个好方法。 ... [详细]
程序员
清除OpenShift上的日志文件 - RedHat

如何解决《清除OpenShift上的日志文件-RedHat》经验，为你挑选了1个好方法。 ... [详细]
程序员
覆盖率如何计算其百分比？

如何解决《覆盖率如何计算其百分比？》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在Spring Boot/Spring数据中为Amazon RDS Mysql启用SSL？

如何解决《如何在SpringBoot/Spring数据中为AmazonRDSMysql启用SSL？》经验，为你挑选了0个好方法。 ... [详细]
程序员
cordova通过git ssh url添加插件？

如何解决《cordova通过gitsshurl添加插件？》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在不反转标点的情况下反转字符串？

如何解决《如何在不反转标点的情况下反转字符串？》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何使用盐栈渲染和转储文件sls而不应用它

如何解决《如何使用盐栈渲染和转储文件sls而不应用它》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用python,boto3在Amazon S3中创建目录

如何解决《使用python,boto3在AmazonS3中创建目录》经验，为你挑选了2个好方法。 ... [详细]
程序员
存储JWT令牌的位置？

如何解决《存储JWT令牌的位置？》经验，为你挑选了2个好方法。 ... [详细]
程序员
stl .series中的错误不是周期性的

如何解决《stl.series中的错误不是周期性的》经验，为你挑选了1个好方法。 ... [详细]
程序员
Javascript - 将字符串作为text/html复制到剪贴板

如何解决《Javascript-将字符串作为text/html复制到剪贴板》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何处理为nodejs中的每个元素应用异步函数的大数组？

如何解决《如何处理为nodejs中的每个元素应用异步函数的大数组？》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用f#时,如何在Api控制器中为每个新方法触摸我的DI容器

如何解决《使用f#时,如何在Api控制器中为每个新方法触摸我的DI容器》经验，为你挑选了1个好方法。 ... [详细]
程序员
基准测试ASP.NET并发请求效果不佳

如何解决《基准测试ASP.NET并发请求效果不佳》经验，为你挑选了0个好方法。 ... [详细]
程序员
Python:字典列表列表

如何解决《Python:字典列表列表》经验，为你挑选了1个好方法。 ... [详细]
程序员
优化snmp库以在iphone中搜索设备的IP地址

如何解决《优化snmp库以在iphone中搜索设备的IP地址》经验，为你挑选了0个好方法。 ... [详细]

雨天是最美

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章