11赞

如何在Spark SQL中找到分组Vector列的平均值？

作者：Chloemw | 2023-09-06 21:25

如何解决《如何在SparkSQL中找到分组Vector列的平均值？》经验，为你挑选了1个好方法。

我RelationalGroupedDataset通过调用创建了一个instances.groupBy(instances.col("property_name")):

val x = instances.groupBy(instances.col("property_name"))



如何组合用户定义的聚合函数来对每个组执行Statistics.colStats().mean？

谢谢!


1> user6910411..：
Spark> = 2.4

你可以使用Summarizer:

import org.apache.spark.ml.stat.Summarizer

val dfNew = df.as[(Int, org.apache.spark.mllib.linalg.Vector)]
  .map { case (group, v) => (group, v.asML) }
  .toDF("group", "features")


dfNew
  .groupBy($"group")
  .agg(Summarizer.mean($"features").alias("means"))
  .show(false)


+-----+--------------------------------------------------------------------+
|group|means                                                               |
+-----+--------------------------------------------------------------------+
|1    |[8.740630742016827E12,2.6124956666260462E14,3.268714653521495E14]   |
|6    |[2.1153266920139112E15,2.07232483974322592E17,6.2715161747245427E17]|
|3    |[6.3781865566442836E13,8.359124419656149E15,1.865567821598214E14]   |
|5    |[4.270201403521642E13,6.561211706745676E13,8.395448246737938E15]    |
|9    |[3.577032684241448E16,2.5432362841314468E16,2.3744826986293008E17]  |
|4    |[2.339253775419023E14,8.517531902022505E13,3.055115780965264E15]    |
|8    |[8.029924756674456E15,7.284873600992855E17,3.08621303029924E15]     |
|7    |[3.2275104122699105E15,7.5472363442090208E16,7.022556624056291E14]  |
|10   |[1.2412562261010224E16,5.741115713769269E15,4.34336779990902E16]    |
|2    |[1.085528901765636E16,7.633370115869126E12,6.952642232477029E11]    |
+-----+--------------------------------------------------------------------+


Spark <2.4

你不能使用,UserDefinedAggregateFunction但你可以Aggregator使用相同的创建MultivariateOnlineSummarizer:

import org.apache.spark.sql.Row
import org.apache.spark.sql.expressions.Aggregator
import org.apache.spark.mllib.linalg.{Vector, Vectors}
import org.apache.spark.sql.{Encoder, Encoders}
import org.apache.spark.sql.catalyst.encoders.ExpressionEncoder
import org.apache.spark.mllib.stat.MultivariateOnlineSummarizer

type Summarizer = MultivariateOnlineSummarizer

case class VectorSumarizer(f: String) extends Aggregator[Row, Summarizer, Vector]
    with Serializable {
  def zero = new Summarizer
  def reduce(acc: Summarizer, x: Row) = acc.add(x.getAs[Vector](f))
  def merge(acc1: Summarizer, acc2: Summarizer) = acc1.merge(acc2)

  // This can be easily generalized to support additional statistics
  def finish(acc: Summarizer) = acc.mean

  def bufferEncoder: Encoder[Summarizer] = Encoders.kryo[Summarizer]
  def outputEncoder: Encoder[Vector] = ExpressionEncoder()
}


用法示例:

import org.apache.spark.mllib.random.RandomRDDs.logNormalVectorRDD

val df = spark.sparkContext.union((1 to 10).map(i => 
  logNormalVectorRDD(spark.sparkContext, i, 10, 10000, 3, 1).map((i, _))
)).toDF("group", "features")

df
 .groupBy($"group")
 .agg(VectorSumarizer("features").toColumn.alias("means"))
 .show(10, false)


结果:

+-----+---------------------------------------------------------------------+
|group|means                                                                |
+-----+---------------------------------------------------------------------+
|1    |[1.0495089547176625E15,3.057434217141363E13,8.180842267228103E13]    |
|6    |[8.578684690153061E15,1.865830977115807E14,1.0690831496167929E15]    |
|3    |[1.0347016972600206E14,4.952536828257269E15,8.498944924018858E13]    |
|5    |[2.2135916061736424E16,1.5137112888230388E14,8.154750681129871E14]   |
|9    |[6.496030194110956E15,6.2697260327708368E16,3.7282521260607136E16]   |
|4    |[2.4518629692233766E14,1.959083619621557E13,5.278689364420169E13]    |
|8    |[1.806052212008392E16,2.0410654639336184E16,6.409495244104527E15]    |
|7    |[1.32896092658714784E17,1.2074042288752348E15,1.10951746294648096E17]|
|10   |[1.6131199347666342E19,1.24546214832341616E17,8.5265750194040304E16] |
|2    |[4.330324858747168E12,6.19671483053885E12,2.2416578004282832E13]     |
+-----+---------------------------------------------------------------------+


注意:


请注意,MultivariateOnlineSummarizer需要"旧式" mllib.linalg.Vector.它无法使用ml.linalg.Vector.要支持这些,您必须在新旧类型之间进行转换.
表现明智,你可能会更好RDDs.



    

    

    
        推荐阅读
        
            
                                
                    
                        程序员
                        使用正确的上下文发送电子邮件
                    

                    
                                                
                        如何解决《使用正确的上下文发送电子邮件》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        SBCL惊喜失效进入浮点？
                    

                    
                                                
                        如何解决《SBCL惊喜失效进入浮点？》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        在使用Spring Data REST存储库时,如何确定RESTful资源的哪些属性在保存之前已更改？
                    

                    
                                                
                        如何解决《在使用SpringDataREST存储库时,如何确定RESTful资源的哪些属性在保存之前已更改？》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        我怎么知道removeEventListener成功了？
                    

                    
                                                
                            
                        
                                                
                        如何解决《我怎么知道removeEventListener成功了？》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        我正在使用SDL函数而不定义SDL_main.那很好吗？
                    

                    
                                                
                        如何解决《我正在使用SDL函数而不定义SDL_main.那很好吗？》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        .Net CultureInfo Month Names返回一个额外的空字符串
                    

                    
                                                
                            
                        
                                                
                        如何解决《.NetCultureInfoMonthNames返回一个额外的空字符串》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        Range-for-loops和std :: vector <bool>
                    

                    
                                                
                        如何解决《Range-for-loops和std::vector<bool>》经验，为你挑选了3个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        在迭代KeyValuePair以外的其他内容时如何输出字典值
                    

                    
                                                
                        如何解决《在迭代KeyValuePair以外的其他内容时如何输出字典值》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        如何在sfproj上使用MSBuild？
                    

                    
                                                
                        如何解决《如何在sfproj上使用MSBuild？》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        Android:使用LeadingMarginSpan在textview中显示项目符号列表？
                    

                    
                                                
                        如何解决《Android:使用LeadingMarginSpan在textview中显示项目符号列表？》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        Golang嵌入式结构
                    

                    
                                                
                        如何解决《Golang嵌入式结构》经验，为你挑选了0个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        JPA Query返回空值 - 具有空列的Composite Key
                    

                    
                                                
                        如何解决《JPAQuery返回空值-具有空列的CompositeKey》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        如何在特定设备上运行命令'ionic run android'？
                    

                    
                                                
                        如何解决《如何在特定设备上运行命令'ionicrunandroid'？》经验，为你挑选了2个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        react-router和cordova无法正常工作
                    

                    
                                                
                        如何解决《react-router和cordova无法正常工作》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        Swift 2.1 [UInt8] --utf8-&gt;字符串？
                    

                    
                                                
                        如何解决《Swift2.1[UInt8]--utf8-&gt;字符串？》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        将键值数据帧转换为列表
                    

                    
                                                
                        如何解决《将键值数据帧转换为列表》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        如何防止回调被送入javascript函数
                    

                    
                                                
                        如何解决《如何防止回调被送入javascript函数》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        在Bootstrap Date Range Picker中配置语言
                    

                    
                                                
                        如何解决《在BootstrapDateRangePicker中配置语言》经验，为你挑选了2个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        保存对立即调用的函数的引用
                    

                    
                                                
                        如何解决《保存对立即调用的函数的引用》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                                
                    
                        程序员
                        既然Swift是开源的,我可以在不是Mac的计算机上编写和编译iOS应用程序吗？
                    

                    
                                                
                        如何解决《既然Swift是开源的,我可以在不是Mac的计算机上编写和编译iOS应用程序吗？》经验，为你挑选了1个好方法。 ...
                        [详细]
                    
                    

                


                

            
        
    

    
        吐了个 "CAO" !
        
            
                吐个槽吧,看都看了
            
            
                
                                        会员登录 | 用户注册
























    

    
        
            
            
                
                    
                
            

            
                Chloemw            

            
                这个屌丝很懒，什么也没留下！            
            
            

                                
                    
                    关注作者
                            

        
    


    
        Tags | 热门标签
        
            
                                
                    actionscrip
                
                                
                    bash
                
                                
                    c#
                
                                
                    c++
                
                                
                    c语言
                
                                
                    erlang
                
                                
                    flutter
                
                                
                    go
                
                                
                    golang
                
                                
                    java
                
                                
                    javascript
                
                                
                    lua
                
                                
                    node.js
                
                                
                    perl
                
                                
                    php
                
                                
                    python
                
                                
                    scala
                
                                
                    typescript
                
                                
            
        
    


    
        RankList | 热门文章
        
            
                                
                    1Botan编译错误VS2015
                
                                
                    2使用DOMElements的THREE.js SphereGeometry Panorama热点
                
                                
                    3将xml字符串反序列化为对象
                
                                
                    4NodeJS x-ray web-scraper:如何关注链接并从子页面获取内容
                
                                
                    5永久添加蜂巢罐
                
                                
                    6将字符串连接到数据库中的现有字符串
                
                                
                    7使用中间变量而不是array.length会使你的for循环变得更快吗？
                
                                
                    8增强了对新跟踪器的电子商务分析跟踪
                
                                
                    9从二叉树中随机选择一个节点
                
                                
                    10如何根据子集函数从数据框中删除行？
                
                                
                    11多个html页面一个js文件？
                
                                
                    12Highcharts:Uncaught TypeError:$(...).highcharts不是函数
                
                                
                    13R数据帧轻松导出和表格格式化为Word？
                
                                
                    14android.support.design.widget.TabLayout的自定义字体
                
                                
                    15在界面中使用泛型
                
                                
                    16转换pandas数据帧中的分类数据
                
                                
                    17与Redis群集的连接失败
                
                                
                    18如何通过Laravel IoC Container访问Orchestra Xml Parser
                
                                
                    19Ionic  - 如何将会话令牌存储为全局(对于app)可访问变量？
                
                                
                    20ng-pattern允许单词之间的空格