使用sqoop将mysql数据导入到hadoop_MySQL

作者：黄晓敏3023 | 2021-08-28 16:06

hadoop的安装配置这里就不讲了。Sqoop的安装也很简单。完成sqoop的安装后，可以这样测试是否可以连接到mysql(注意：mysql的jar包要放到SQOOP_HOMElib下)：sqooplist-databases--connectjdbc:mysq

hadoop的安装配置这里就不讲了。

Sqoop的安装也很简单。完成sqoop的安装后，可以这样测试是否可以连接到mysql(注意：mysql的jar包要放到 SQOOP_HOME/lib 下)： sqoop list-databases --connect jdbc:mysql://192.168.1.109:3306/ --username root --password 19891231 结果如下

即说明sqoop已经可以正常使用了。下面，要将mysql中的数据导入到hadoop中。我准备的是一个300万条数据的身份证数据表：

先启动hive（使用命令行：hive 即可启动）然后使用sqoop导入数据到hive： sqoop import --connect jdbc:mysql://192.168.1.109:3306/hadoop --username root --password 19891231 --table test_sfz --hive-import sqoop 会启动job来完成导入工作。

完成导入用了2分20秒，还是不错的。在hive中可以看到刚刚导入的数据表：

我们来一句sql测试一下数据： select * from test_sfz where id < 10;

可以看到，hive完成这个任务用了将近25秒，确实是挺慢的（在mysql中几乎是不费时间），但是要考虑到hive是创建了job在hadoop中跑，时间当然多。

接下来，我们会对这些数据进行复杂查询的测试：我机子的配置如下：

hadoop 是运行在虚拟机上的伪分布式，虚拟机OS是ubuntu12.04 64位，配置如下：

TEST 1 计算平均年龄

测试数据：300.8 W 1. 计算广东的平均年龄 mysql：select (sum(year(NOW()) - SUBSTRING(borth,1,4))/count(*)) as ageAvge from test_sfz where address like '广东%'; 用时： 0.877s hive：select (sum(year('2014-10-01') - SUBSTRING(borth,1,4))/count(*)) as ageAvge from test_sfz where address like '广东%'; 用时：25.012s 2. 对每个城市的的平均年龄进行从高到低的排序 mysql：select address, (sum(year(NOW()) - SUBSTRING(borth,1,4))/count(*)) as ageAvge from test_sfz GROUP BY address order by ageAvge desc; 用时：2.949s hive：select address, (sum(year('2014-10-01') - SUBSTRING(borth,1,4))/count(*)) as ageAvge from test_sfz GROUP BY address order by ageAvge desc; 用时：51.29s 可以看到，在耗时上面，hive的增长速度较mysql慢。

TEST 2

测试数据：1200W mysql 引擎： MyISAM（为了加快查询速度）导入到hive：

1. 计算广东的平均年龄 mysql：select (sum(year(NOW()) - SUBSTRING(borth,1,4))/count(*)) as ageAvge from test_sfz2 where address like '广东%'; 用时： 5.642s hive：select (sum(year('2014-10-01') - SUBSTRING(borth,1,4))/count(*)) as ageAvge from test_sfz2 where address like '广东%'; 用时：168.259s 2. 对每个城市的的平均年龄进行从高到低的排序 mysql：select address, (sum(year(NOW()) - SUBSTRING(borth,1,4))/count(*)) as ageAvge from test_sfz2 GROUP BY address order by ageAvge desc; 用时：11.964s hive：select address, (sum(year('2014-10-01') - SUBSTRING(borth,1,4))/count(*)) as ageAvge from test_sfz2 GROUP BY address order by ageAvge desc; 用时：311.714s

TEST 3

测试数据：2000W mysql 引擎： MyISAM（为了加快查询速度）导入到hive：

（这次用的时间很短！可能是因为TEST2中的导入时，我的主机在做其他耗资源的工作..） 1. 计算广东的平均年龄 mysql：select (sum(year(NOW()) - SUBSTRING(borth,1,4))/count(*)) as ageAvge from test_sfz2 where address like '广东%'; 用时： 6.605s hive：select (sum(year('2014-10-01') - SUBSTRING(borth,1,4))/count(*)) as ageAvge from test_sfz2 where address like '广东%'; 用时：188.206s 2. 对每个城市的的平均年龄进行从高到低的排序 mysql：select address, (sum(year(NOW()) - SUBSTRING(borth,1,4))/count(*)) as ageAvge from test_sfz2 GROUP BY address order by ageAvge desc; 用时：19.926s hive：select address, (sum(year('2014-10-01') - SUBSTRING(borth,1,4))/count(*)) as ageAvge from test_sfz2 GROUP BY address order by ageAvge desc; 用时：411.816s

推荐阅读

程序员
SQL BETWEEN命令不适用于大范围

如何解决《SQLBETWEEN命令不适用于大范围》经验，为你挑选了1个好方法。 ... [详细]
程序员
Ruby - 如何从嵌套在哈希中的数组访问键

如何解决《Ruby-如何从嵌套在哈希中的数组访问键》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何理解React Native中"向Javascript发送事件"中的"ReactContext"

如何解决《如何理解ReactNative中"向Javascript发送事件"中的"ReactContext"》经验，为你挑选了0个好方法。 ... [详细]
程序员
使用Require JS的angularJS App中的子资源完整性

如何解决《使用RequireJS的angularJSApp中的子资源完整性》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何支持使用UILabel自动调整UITableViewCell的大小

如何解决《如何支持使用UILabel自动调整UITableViewCell的大小》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何在android studio中添加卫星视图？

如何解决《如何在androidstudio中添加卫星视图？》经验，为你挑选了2个好方法。 ... [详细]
程序员
如何在Python中安装VLC模块

如何解决《如何在Python中安装VLC模块》经验，为你挑选了2个好方法。 ... [详细]
程序员
在chrome新版本中打印隐藏部分的预览边距

如何解决《在chrome新版本中打印隐藏部分的预览边距》经验，为你挑选了0个好方法。 ... [详细]
程序员
使用POST的基于Amazon AWS S3浏览器的上传 -

如何解决《使用POST的基于AmazonAWSS3浏览器的上传-》经验，为你挑选了1个好方法。 ... [详细]
程序员
在r中计数为零时按计数分组

如何解决《在r中计数为零时按计数分组》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何使用mysqli_fetch_assoc从mysql获取所有行并转换为JSON

如何解决《如何使用mysqli_fetch_assoc从mysql获取所有行并转换为JSON》经验，为你挑选了1个好方法。 ... [详细]
程序员
AWS Lambda函数不接受Twilio模块

如何解决《AWSLambda函数不接受Twilio模块》经验，为你挑选了1个好方法。 ... [详细]
程序员
R小册子如何点击地图并添加一个圆圈

如何解决《R小册子如何点击地图并添加一个圆圈》经验，为你挑选了1个好方法。 ... [详细]
程序员
加载MySQLdb模块时出错:libmysqlclient.so.20:无法打开共享对象文件:没有这样的文件或目录

如何解决《加载MySQLdb模块时出错:libmysqlclient.so.20:无法打开共享对象文件:没有这样的文件或目录》经验，为你挑选了2个好方法。 ... [详细]
程序员
使用astropy.io.fits编写适合文件

如何解决《使用astropy.io.fits编写适合文件》经验，为你挑选了1个好方法。 ... [详细]
程序员
Pythonic维护变量赋值的方法

如何解决《Pythonic维护变量赋值的方法》经验，为你挑选了0个好方法。 ... [详细]
程序员
在什么情况下你会使用一个返回另一个函数(Javascript)的函数？

如何解决《在什么情况下你会使用一个返回另一个函数(Javascript)的函数？》经验，为你挑选了0个好方法。 ... [详细]
程序员
带有CORS转储数据的Django 1.9:"corsheaders_corsmodel"不存在

如何解决《带有CORS转储数据的Django1.9:"corsheaders_corsmodel"不存在》经验，为你挑选了1个好方法。 ... [详细]
程序员
如何设计一些常量是否由多个类使用

如何解决《如何设计一些常量是否由多个类使用》经验，为你挑选了0个好方法。 ... [详细]
程序员
访问for-of循环内的ES6数组元素索引

如何解决《访问for-of循环内的ES6数组元素索引》经验，为你挑选了3个好方法。 ... [详细]

黄晓敏3023

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章