python爬虫一般都爬什么信息

作者：yzh148448 | 2022-11-24 17:50

python爬虫一般都针对特定领域主题进行爬取，比如专门爬取小说目录以及章节的垂直爬虫；或者爬取一些需要用户提交关键词才能获得的Web页面。

python爬虫一般都爬什么信息？

一般说爬虫的时候，大部分程序员潜意识里都会联想为Python爬虫，为什么会这样，我觉得有两个原因：

1.Python生态极其丰富，诸如Request、Beautiful Soup、Scrapy、PySpider等第三方库实在强大

2.Python语法简洁易上手，分分钟就能写出一个爬虫（有人吐槽Python慢，但是爬虫的瓶颈和语言关系不大）

爬虫是一个程序，这个程序的目的就是为了抓取万维网信息资源，比如你日常使用的谷歌等搜索引擎，搜索结果就全都依赖爬虫来定时获取

看上述搜索结果，除了wiki相关介绍外，爬虫有关的搜索结果全都带上了Python，前人说Python爬虫，现在看来果然诚不欺我～

爬虫的目标对象也很丰富，不论是文字、图片、视频，任何结构化非结构化的数据爬虫都可以爬取，爬虫经过发展，也衍生出了各种爬虫类型：

● 通用网络爬虫：爬取对象从一些种子 URL 扩充到整个 Web，搜索引擎干的就是这些事

● 垂直网络爬虫：针对特定领域主题进行爬取，比如专门爬取小说目录以及章节的垂直爬虫

● 增量网络爬虫：对已经抓取的网页进行实时更新

● 深层网络爬虫：爬取一些需要用户提交关键词才能获得的 Web 页面

不想说这些大方向的概念，让我们以一个获取网页内容为例，从爬虫技术本身出发，来说说网页爬虫，步骤如下：

模拟请求网页资源

从HTML提取目标元素

数据持久化

推荐阅读

程序员
智能单元测试:参考Microsoft.Pex.Framework.dll的正确方法是什么？

如何解决《智能单元测试:参考Microsoft.Pex.Framework.dll的正确方法是什么？》经验，为你挑选了1个好方法。 ... [详细]
程序员
Theano CUDA例外

如何解决《TheanoCUDA例外》经验，为你挑选了0个好方法。 ... [详细]
程序员
WPF Adorner Layer Outside Window

如何解决《WPFAdornerLayerOutsideWindow》经验，为你挑选了1个好方法。 ... [详细]
程序员
Sequelize通过Unix套接字连接到Postgres

如何解决《Sequelize通过Unix套接字连接到Postgres》经验，为你挑选了0个好方法。 ... [详细]
程序员
XlsxWriter python在特定单元格中写入数据帧

如何解决《XlsxWriterpython在特定单元格中写入数据帧》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用Tensorflow的多变量时间序列RNN.这可能是LSTM细胞或类似的吗？

如何解决《使用Tensorflow的多变量时间序列RNN.这可能是LSTM细胞或类似的吗？》经验，为你挑选了0个好方法。 ... [详细]
程序员
C中的代码:64位系统中的int数组函数参数问题

如何解决《C中的代码:64位系统中的int数组函数参数问题》经验，为你挑选了1个好方法。 ... [详细]
程序员
jquery中数据的用途？(vs将我自己的字段添加到Jquery对象)

如何解决《jquery中数据的用途？(vs将我自己的字段添加到Jquery对象)》经验，为你挑选了1个好方法。 ... [详细]
程序员
在Spring Rest中使用JSON的HTTP POST

如何解决《在SpringRest中使用JSON的HTTPPOST》经验，为你挑选了1个好方法。 ... [详细]
程序员
swagger JSON文件的空值

如何解决《swaggerJSON文件的空值》经验，为你挑选了1个好方法。 ... [详细]
程序员
MSBuild"sgen.exe"丢失了

如何解决《MSBuild"sgen.exe"丢失了》经验，为你挑选了1个好方法。 ... [详细]
程序员
If-else在React Stateless功能组件中

如何解决《If-else在ReactStateless功能组件中》经验，为你挑选了2个好方法。 ... [详细]
程序员
为电报API创建授权密钥后的步骤

如何解决《为电报API创建授权密钥后的步骤》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用.pem文件通过ssh连接

如何解决《使用.pem文件通过ssh连接》经验，为你挑选了3个好方法。 ... [详细]
程序员
MVC View Scaffolding不使用Generic基类？

如何解决《MVCViewScaffolding不使用Generic基类？》经验，为你挑选了0个好方法。 ... [详细]
程序员
无法匹配模板类中模板函数的函数声明

如何解决《无法匹配模板类中模板函数的函数声明》经验，为你挑选了1个好方法。 ... [详细]
程序员
Laravel缩小CSS和JS文件

如何解决《Laravel缩小CSS和JS文件》经验，为你挑选了1个好方法。 ... [详细]
程序员
创建对象之间是否存在任何差异,然后将其返回或直接创建并返回？

如何解决《创建对象之间是否存在任何差异,然后将其返回或直接创建并返回？》经验，为你挑选了2个好方法。 ... [详细]
程序员
如何在Sublime Text 3中将焦点从搜索栏更改为编辑器？

如何解决《如何在SublimeText3中将焦点从搜索栏更改为编辑器？》经验，为你挑选了2个好方法。 ... [详细]
程序员
Javascript语法 - if语句

如何解决《Javascript语法-if语句》经验，为你挑选了1个好方法。 ... [详细]

yzh148448

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章