11赞

java 中Spark中将对象序列化存储到hdfs

作者：ERIK又 | 2022-10-26 19:47

这篇文章主要介绍了java中Spark中将对象序列化存储到hdfs的相关资料,需要的朋友可以参考下

java 中Spark中将对象序列化存储到hdfs

摘要: Spark应用中经常会遇到这样一个需求: 需要将JAVA对象序列化并存储到HDFS, 尤其是利用MLlib计算出来的一些模型, 存储到hdfs以便模型可以反复利用. 下面的例子演示了Spark环境下从Hbase读取数据, 生成一个word2vec模型, 存储到hdfs.

废话不多说, 直接贴代码了. spark1.4 + hbase0.98

import org.apache.spark.storage.StorageLevel
import scala.collection.JavaConverters._
import java.io.File
import java.io.FileInputStream
import java.io.FileOutputStream
import java.io.ObjectInputStream
import java.io.ObjectOutputStream
import java.net.URI
import java.util.Date
import org.ansj.library.UserDefineLibrary
import org.ansj.splitWord.analysis.NlpAnalysis
import org.ansj.splitWord.analysis.ToAnalysis
import org.apache.hadoop.fs.FSDataInputStream
import org.apache.hadoop.fs.FSDataOutputStream
import org.apache.hadoop.fs.FileSystem
import org.apache.hadoop.fs.FileUtil
import org.apache.hadoop.fs.Path
import org.apache.hadoop.hbase.client._
import org.apache.hadoop.hbase.{HBaseConfiguration, HTableDescriptor, TableName}
import org.apache.hadoop.hbase.filter.FilterList
import org.apache.hadoop.hbase.filter.PageFilter
import org.apache.hadoop.hbase.filter.RegexStringComparator
import org.apache.hadoop.hbase.filter.SingleColumnValueFilter
import org.apache.hadoop.hbase.filter.CompareFilter.CompareOp
import org.apache.hadoop.hbase.mapreduce.TableInputFormat
import org.apache.hadoop.hbase.protobuf.ProtobufUtil
import org.apache.hadoop.hbase.util.{Base64, Bytes}
import com.feheadline.fespark.db.Neo4jManager
import com.feheadline.fespark.util.Env
import org.apache.spark.SparkConf
import org.apache.spark.SparkContext
import org.apache.spark.rdd._
import org.apache.spark.mllib.feature.{Word2Vec, Word2VecModel}
import scala.math.log
import scala.io.Source

object Word2VecDemo {

 def convertScanToString(scan: Scan) = {
  val proto = ProtobufUtil.toScan(scan)
  Base64.encodeBytes(proto.toByteArray)
 }

 def main(args: Array[String]): Unit = {
  val sparkConf = new SparkConf().setAppName("Word2Vec Demo")
  sparkConf.set("spark.serializer", "org.apache.spark.serializer.KryoSerializer")
  sparkConf.set("spark.kryoserializer.buffer", "256m")
  sparkConf.set("spark.kryoserializer.buffer.max","2046m")
  sparkConf.set("spark.akka.frameSize", "500")
  sparkConf.set("spark.rpc.askTimeout", "30")
  

  val sc = new SparkContext(sparkConf)
  val hbaseConf = HBaseConfiguration.create()
  hbaseConf.set("hbase.zookeeper.quorum", "myzookeeper")

  hbaseConf.set(TableInputFormat.INPUT_TABLE, "crawled")

  val scan = new Scan()
  val filterList:FilterList = new FilterList(FilterList.Operator.MUST_PASS_ALL)
  
  val comp:RegexStringComparator = new RegexStringComparator(""".{1500,}""")
  
  val articleFilter:SingleColumnValueFilter = new SingleColumnValueFilter(
  "data".getBytes,
  "article".getBytes,
  CompareOp.EQUAL,
  comp
  )
  
  filterList.addFilter(articleFilter)
  filterList.addFilter(new PageFilter(100))
  
  scan.setFilter(filterList)
  scan.setCaching(50)
  scan.setCacheBlocks(false)
  hbaseConf.set(TableInputFormat.SCAN,convertScanToString(scan))

  val crawledRDD = sc.newAPIHadoopRDD(
   hbaseConf,
   classOf[TableInputFormat],
   classOf[org.apache.hadoop.hbase.io.ImmutableBytesWritable],
   classOf[org.apache.hadoop.hbase.client.Result]
  )
 
  val articlesRDD = crawledRDD.filter{
   case (_,result) => {
     val content = Bytes.toString(result.getValue("data".getBytes,"article".getBytes))
     content != null
   }
  }

  val wordsInDoc = articlesRDD.map{
   case (_,result) => {
     val content = Bytes.toString(result.getValue("data".getBytes,"article".getBytes))
     if(content!=null)ToAnalysis.parse(content).asScala.map(_.getName).toSeq
     else Seq("")
   }
  }
  
  val fitleredWordsInDoc = wordsInDoc.filter(_.nonEmpty)
  
  val word2vec = new Word2Vec()
  val model = word2vec.fit(fitleredWordsInDoc)
  
  //---------------------------------------重点看这里-------------------------------------------------------------
  //将上面的模型存储到hdfs
  val hadoopConf = sc.hadoopConfiguration
  hadoopConf.set("fs.defaultFS", "hdfs://myhadoop:9000/")
  val fileSystem = FileSystem.get(hadoopConf)
  val path = new Path("/user/hadoop/data/mllib/word2vec-object")
  val oos = new ObjectOutputStream(new FSDataOutputStream(fileSystem.create(path)))
  oos.writeObject(model)
  oos.close
  
  //这里示例另外一个程序直接从hdfs读取序列化对象使用模型
  val ois = new ObjectInputStream(new FSDataInputStream(fileSystem.open(path)))
  val sample_model = ois.readObject.asInstanceOf[Word2VecModel]
  
  /*
  * //你还可以将序列化文件从hdfs放到本地, scala程序使用模型
  * import java.io._
  * import org.apache.spark.mllib.feature.{Word2Vec, Word2VecModel}
  * val ois = new ObjectInputStream(new FileInputStream("/home/cherokee/tmp/word2vec-object"))
  * val sample_model = ois.readObject.asInstanceOf[Word2VecModel]
  * ois.close
  */
  //--------------------------------------------------------------------------------------------------------------
 }
}

感谢阅读，希望能帮助到大家，谢谢大家对本站的支持！

推荐阅读

程序员
滚动div自动收报机

如何解决《滚动div自动收报机》经验，为你挑选了1个好方法。 ... [详细]
程序员
ASP.net 5.0 - WebAPI授权和ErrorCode 302而不是401

如何解决《ASP.net5.0-WebAPI授权和ErrorCode302而不是401》经验，为你挑选了0个好方法。 ... [详细]
程序员
文件中最少的常用词

如何解决《文件中最少的常用词》经验，为你挑选了1个好方法。 ... [详细]
程序员
使用JS和HTML将当前URL插入到链接中

如何解决《使用JS和HTML将当前URL插入到链接中》经验，为你挑选了0个好方法。 ... [详细]
程序员
Spark Streaming Kafka流

如何解决《SparkStreamingKafka流》经验，为你挑选了1个好方法。 ... [详细]
程序员
flexbox在Safari中添加1px左边距

如何解决《flexbox在Safari中添加1px左边距》经验，为你挑选了2个好方法。 ... [详细]
程序员
Kotlin中的2D阵列

如何解决《Kotlin中的2D阵列》经验，为你挑选了3个好方法。 ... [详细]
程序员
等待新任务<T>(...):任务不运行？

如何解决《等待新任务<T>():任务不运行？》经验，为你挑选了2个好方法。 ... [详细]
程序员
Navigator Invariant Violation:onlyChild必须传递只有一个孩子的孩子

如何解决《NavigatorInvariantViolation:onlyChild必须传递只有一个孩子的孩子》经验，为你挑选了1个好方法。 ... [详细]
程序员
libGDX设置允许我使用在Android中崩溃的Java 8

如何解决《libGDX设置允许我使用在Android中崩溃的Java8》经验，为你挑选了0个好方法。 ... [详细]
程序员
将argparse转义字符作为选项处理

如何解决《将argparse转义字符作为选项处理》经验，为你挑选了0个好方法。 ... [详细]
程序员
Autofac/FluentValidation:从请求实例的作用域中看不到具有匹配'AutofacWebRequest'的标记的作用域

如何解决《Autofac/FluentValidation:从请求实例的作用域中看不到具有匹配'AutofacWebRequest'的标记的作用域》经验，为你挑选了1个好方法。 ... [详细]
程序员
ng-token-auth,ionic,devise_token_auth; 令牌在xhr请求中随机丢失

如何解决《ng-token-auth,ionic,devise_token_auth;令牌在xhr请求中随机丢失》经验，为你挑选了0个好方法。 ... [详细]
程序员
如何使用新的Zend API升级PHP函数参数？

如何解决《如何使用新的ZendAPI升级PHP函数参数？》经验，为你挑选了1个好方法。 ... [详细]
程序员
如果没有人接听,请转发twilio呼叫语音邮件

如何解决《如果没有人接听,请转发twilio呼叫语音邮件》经验，为你挑选了1个好方法。 ... [详细]
程序员
System.Zip.TZipFile.ExtractZipFile对某些文件引发错误。为什么？

如何解决《System.Zip.TZipFile.ExtractZipFile对某些文件引发错误。为什么？》经验，为你挑选了1个好方法。 ... [详细]
程序员
ValueError:使用conda命令后无法解析CPython sys.version

如何解决《ValueError:使用conda命令后无法解析CPythonsys.version》经验，为你挑选了2个好方法。 ... [详细]
程序员
Rmarkdown图像跳过文本

如何解决《Rmarkdown图像跳过文本》经验，为你挑选了1个好方法。 ... [详细]
程序员
在Access中使用SQL Server存储过程的输出参数

如何解决《在Access中使用SQLServer存储过程的输出参数》经验，为你挑选了1个好方法。 ... [详细]
程序员
ReactiveX:Group和Buffer仅为每个组中的最后一项

如何解决《ReactiveX:Group和Buffer仅为每个组中的最后一项》经验，为你挑选了0个好方法。 ... [详细]

ERIK又

这个屌丝很懒，什么也没留下！

关注作者

Tags | 热门标签

RankList | 热门文章