20赞

Python爬虫入门有哪些基础知识点

作者：路人甲 | 2021-10-27 04:57

在本篇文章中小编给大家整理的是关于Python爬虫入门基础知识点整理，有兴趣的朋友们可以跟着学习下。

1、什么是爬虫

爬虫，即网络爬虫，大家可以理解为在网络上爬行的一直蜘蛛，互联网就比作一张大网，而爬虫便是在这张网上爬来爬去的蜘蛛咯，如果它遇到资源，那么它就会抓取下来。想抓取什么？这个由你来控制它咯。

比如它在抓取一个网页，在这个网中他发现了一条道路，其实就是指向网页的超链接，那么它就可以爬到另一张网上来获取数据。这样，整个连在一起的大网对这之蜘蛛来说触手可及，分分钟爬下来不是事儿。

2、浏览网页的过程

在用户浏览网页的过程中，我们可能会看到许多好看的图片，比如 http://image.baidu.com/ ，我们会看到几张的图片以及百度搜索框，这个过程其实就是用户输入网址之后，经过DNS服务器，找到服务器主机，向服务器发出一个请求，服务器经过解析之后，发送给用户的浏览器 HTML、JS、CSS 等文件，浏览器解析出来，用户便可以看到形形色色的图片了。

因此，用户看到的网页实质是由 HTML 代码构成的，爬虫爬来的便是这些内容，通过分析和过滤这些 HTML 代码，实现对图片、文字等资源的获取。

3、URL的含义

URL，即统一资源定位符，也就是我们说的网址，统一资源定位符是对可以从互联网上得到的资源的位置和访问方法的一种简洁的表示，是互联网上标准资源的地址。互联网上的每个文件都有一个唯一的URL，它包含的信息指出文件的位置以及浏览器应该怎么处理它。

URL的格式由三部分组成：

①第一部分是协议(或称为服务方式)。

②第二部分是存有该资源的主机IP地址(有时也包括端口号)。

③第三部分是主机资源的具体地址，如目录和文件名等。

爬虫爬取数据时必须要有一个目标的URL才可以获取数据，因此，它是爬虫获取数据的基本依据，准确理解它的含义对爬虫学习有很大帮助。

4、环境的配置

学习Python，当然少不了环境的配置，最初我用的是Notepad++，不过发现它的提示功能实在是太弱了，于是，在Windows下我用了PyCharm，在Linux下我用了Eclipse for Python，另外还有几款比较优秀的IDE，大家可以参考这篇文章学习Python推荐的IDE 。好的开发工具是前进的推进器，希望大家可以找到适合自己的IDE。

知识点补充：

什么是爬虫和爬虫的基本逻辑

“爬虫”是一种形象的说法。互联网比喻成一张大网，爬虫是一个程序或脚本在这种大网上爬走。碰到虫子（资源），若是所需的资源就获取或下载下来。这个资源通常是网页、文件等等。可以通过该资源里面的url链接，顺藤摸瓜继续爬取这些链接的资源。

你也可以把爬虫当作模拟我们正常上网。打开网页并分析网页的内容获取我们想要的东西。

那么，这里就涉及到http传输协议等相关的知识。

我们通常打开一个网页，基本上都是打开一个Url链接即可。在这个过程当中，实际上发生了很多事情。

打开一个Url链接，浏览器自动向Url链接的服务器发送一个请求(Request)，告诉服务器说我需要访问这个Url链接的内容，请返回数据给我。服务器就处理该请求，响应该请求并返回结果给浏览器。

既然爬虫需要模拟该过程。根据http协议，爬虫需要构造一个请求(Request)，发到请求到目标服务器(通常是Url链接)。然后等待服务器的响应(Response)。

所有相关的数据都在这个响应结果当中，这个就是爬虫实现的基本逻辑。

以上就是Python爬虫入门有哪些基础知识点的详细内容，更多关于Python爬虫入门的资料请关注其它相关文章！

推荐阅读

程序员
以ansible条件评估返回代码

如何解决《以ansible条件评估返回代码》经验，为你挑选了1个好方法。 ... [详细]
程序员
在OS X上安装C++库

如何解决《在OSX上安装C++库》经验，为你挑选了1个好方法。 ... [详细]
程序员
带参数的ZSH别名

如何解决《带参数的ZSH别名》经验，为你挑选了3个好方法。 ... [详细]
程序员
Qt/C++ - 生成的条形码不可读

如何解决《Qt/C++-生成的条形码不可读》经验，为你挑选了1个好方法。 ... [详细]
程序员
在R Shiny中使用jQuery时，情节消失

如何解决《在RShiny中使用jQuery时，情节消失》经验，为你挑选了1个好方法。 ... [详细]
程序员
在ubuntu中找不到pthread_create

如何解决《在ubuntu中找不到pthread_create》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何围绕sourceRect的角落来寻找Peek和Pop 3D Touch？

如何解决《如何围绕sourceRect的角落来寻找Peek和Pop3DTouch？》经验，为你挑选了1个好方法。 ... [详细]
程序员
我应该在控制器或模型中使用Ecto.Repo用于Elixir Phoenix吗？

如何解决《我应该在控制器或模型中使用Ecto.Repo用于ElixirPhoenix吗？》经验，为你挑选了1个好方法。 ... [详细]
程序员
适配器类中的super.onActivityResult？Android的

如何解决《适配器类中的super.onActivityResult？Android的》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用bash进程替换和尾部的结果不正确？

如何解决《使用bash进程替换和尾部的结果不正确？》经验，为你挑选了1个好方法。 ... [详细]
程序员
自定义构建键绑定sublime文本

如何解决《自定义构建键绑定sublime文本》经验，为你挑选了1个好方法。 ... [详细]
程序员
由从未引用的对象创建的垃圾

如何解决《由从未引用的对象创建的垃圾》经验，为你挑选了1个好方法。 ... [详细]
程序员
SymbolFinder.FindReferencesAsync找不到任何内容

如何解决《SymbolFinder.FindReferencesAsync找不到任何内容》经验，为你挑选了1个好方法。 ... [详细]
程序员
是否有一个基本的角度指令用于读取更多/更少的文本

如何解决《是否有一个基本的角度指令用于读取更多/更少的文本》经验，为你挑选了0个好方法。 ... [详细]
程序员
Firebase未向REST请求添加CORS标头

如何解决《Firebase未向REST请求添加CORS标头》经验，为你挑选了1个好方法。 ... [详细]
程序员
long-poll jQuery.ajax()在手机休眠后无法回调？

如何解决《long-polljQuery.ajax()在手机休眠后无法回调？》经验，为你挑选了0个好方法。 ... [详细]
程序员
iOS UI测试在一个被隔绝的看法

如何解决《iOSUI测试在一个被隔绝的看法》经验，为你挑选了2个好方法。 ... [详细]
程序员
番茄钟计时器:变量值变为'NaN'

如何解决《番茄钟计时器:变量值变为'NaN'》经验，为你挑选了0个好方法。 ... [详细]
程序员
向UITableViewCell Swift添加渐变背景

如何解决《向UITableViewCellSwift添加渐变背景》经验，为你挑选了1个好方法。 ... [详细]
程序员
码头工人-PG :: ConnectionBad

如何解决《码头工人-PG::ConnectionBad》经验，为你挑选了0个好方法。 ... [详细]

路人甲

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章