12赞

python数据爬下来保存在哪里

作者：李桂平2402851397 | 2022-02-02 03:30

python数据爬下来保存在本地，一般是文件或数据库中，但是文件形式相比要更加简单，如果只是自己写爬虫玩，可以用文件形式来保存数据。

昨天下班后忽然兴起想写一个爬虫抓抓网页上的东西。花了一个钟简单学习了python的基础语法，然后参照网上的例子自己写了个爬虫。（推荐学习：Python视频教程）

python数据爬下来保存在本地，一般是文件或数据库中，但是文件形式相比要更加简单，如果只是自己写爬虫玩，可以用文件形式来保存数据。

#coding=utf-8
import urllib.request
import re
import os
 
'''
Urllib 模块提供了读取web页面数据的接口，我们可以像读取本地文件一样读取www和ftp上的数据
urlopen 方法用来打开一个url
read方法 用于读取Url上的数据
'''
 
def getHtml(url):
    page = urllib.request.urlopen(url);
    html = page.read();
    return html;
 
def getImg(html):
    imglist = re.findall('img src="(http.*?)"',html)
    return imglist
 
html = getHtml("https://www.zhihu.com/question/34378366").decode("utf-8");
imagesUrl = getImg(html);
 
if os.path.exists("D:/imags") == False:
    os.mkdir("D:/imags");
    
count = 0;
for url in imagesUrl:
    print(url)
    if(url.find('.') != -1):
        name = url[url.find('.',len(url) - 5):];
        bytes = urllib.request.urlopen(url);
        f = open("D:/imags/"+str(count)+name, 'wb');
        f.write(bytes.read());
        f.flush();
        f.close();
        count+=1;

经测试，基本功能还是可以实现的。花的较多的时间就是正则匹配哪里，因为自己对正则表达式也不是非常熟悉。所以还是花了点时间。

注：上面的程序基于 python 3.5。python3 和 python2 还是有些区别的。我刚开始看基础语法的时候就栽了一些坑里。

以上就是python数据爬下来保存在哪里的详细内容，更多请关注其它相关文章！

推荐阅读

程序员
为什么我不能在数据模板中使用{x:Bind {RelativeSource Self}}？

如何解决《为什么我不能在数据模板中使用{x:Bind{RelativeSourceSelf}}？》经验，为你挑选了1个好方法。 ... [详细]
程序员
具有ASP.NET身份3的JWT承载令牌

如何解决《具有ASP.NET身份3的JWT承载令牌》经验，为你挑选了0个好方法。 ... [详细]
程序员
函数声明语法:函数名前的括号内的东西

如何解决《函数声明语法:函数名前的括号内的东西》经验，为你挑选了2个好方法。 ... [详细]
程序员
Django反向导致url循环导入,为什么？

如何解决《Django反向导致url循环导入,为什么？》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用Sumiif（）合并单元格的条件总和

如何解决《使用Sumiif（）合并单元格的条件总和》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何从AWS Lambda函数查询第三方JSON API

如何解决《如何从AWSLambda函数查询第三方JSONAPI》经验，为你挑选了1个好方法。 ... [详细]
程序员
可选的Promise API

如何解决《可选的PromiseAPI》经验，为你挑选了1个好方法。 ... [详细]
程序员
Angularjs何时何地绑定事件

如何解决《Angularjs何时何地绑定事件》经验，为你挑选了1个好方法。 ... [详细]
程序员
在JavaScript事件回调中绑定"this"的正确方法？

如何解决《在JavaScript事件回调中绑定"this"的正确方法？》经验，为你挑选了1个好方法。 ... [详细]
程序员
在Robolectric中测试文件创建

如何解决《在Robolectric中测试文件创建》经验，为你挑选了0个好方法。 ... [详细]
程序员
RuntimeError:针对API版本a编译的模块,但是这个版本的numpy在ubuntu中是9

如何解决《RuntimeError:针对API版本a编译的模块,但是这个版本的numpy在ubuntu中是9》经验，为你挑选了0个好方法。 ... [详细]
程序员
将angular指令添加到rails中的simple_form会破坏集合输入的选定选项

如何解决《将angular指令添加到rails中的simple_form会破坏集合输入的选定选项》经验，为你挑选了0个好方法。 ... [详细]
程序员
删除列表项单词后面的逗号

如何解决《删除列表项单词后面的逗号》经验，为你挑选了1个好方法。 ... [详细]
程序员
有谁真的知道如何解决这些错误？

如何解决《有谁真的知道如何解决这些错误？》经验，为你挑选了1个好方法。 ... [详细]
程序员
Maven版本插件：更新插件

如何解决《Maven版本插件：更新插件》经验，为你挑选了0个好方法。 ... [详细]
程序员
lsof打印数字端口

如何解决《lsof打印数字端口》经验，为你挑选了1个好方法。 ... [详细]
程序员
打字稿类型转换不起作用

如何解决《打字稿类型转换不起作用》经验，为你挑选了2个好方法。 ... [详细]
程序员
解释PlayFramework 2中的测试工具之间的差异(WithApplication,WithServer,WithBrowser,InMemory等...)

如何解决《解释PlayFramework2中的测试工具之间的差异(WithApplication,WithServer,WithBrowser,InMemory等)》经验，为你挑选了1个好方法。 ... [详细]
程序员
如果它们具有相同的名称并且我无法修改其他文件,如何在其他C文件中使用具有相同名称的多个函数？

如何解决《如果它们具有相同的名称并且我无法修改其他文件,如何在其他C文件中使用具有相同名称的多个函数？》经验，为你挑选了1个好方法。 ... [详细]
程序员
Google Apps脚本，选择一个工作表

如何解决《GoogleApps脚本，选择一个工作表》经验，为你挑选了1个好方法。 ... [详细]

李桂平2402851397

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章