必发bifa88手机客服端Elasticsearch聚合初探

Elasticsearch是一款提供找寻以及相关度排序的开源框架,同时,也支撑对存款和储蓄的文书档案举办复杂的计算——聚合。

前言

ES中的聚合被分为两大类:Metric衡量和bucket桶(原谅小编立陶宛共和国(Republic of Lithuania)语差,找不到适合的词语…..就用单词来说吧!)。说的通俗点,metric很像SQL中的avg、max、min等办法,而bucket就有点类似group by了。

本篇就简单的牵线一下metric聚合的用法。

metric的相会遵照值的归来类型能够分为二种:单值聚合 和 多值聚合。

单值聚合

Sum 求和

其一聚合再次来到的是单个值,dsl能够参见如下:

"aggs" : {
        "intraday_return" : { "sum" : { "field" : "change" } }
    }

重临的是change字段的和:

{
    ...

    "aggregations": {
        "intraday_return": {
           "value": 2.18
        }
    }
}

其中intraday_return是集结的名字,同时也会作为请求再次来到的id值。别的,聚合中是支撑脚本的,那里就不过多废话了,详细参考官方文档即可。

Min 求最小值

{
    "aggs" : {
        "min_price" : { "min" : { "field" : "price" } }
    }
}

必发bifa88手机客服端,马克斯 求最大值

{
    "aggs" : {
        "max_price" : { "max" : { "field" : "price" } }
    }
}

avg 求平均值

{
    "aggs" : {
        "avg_grade" : { "avg" : { "field" : "grade" } }
    }
}

cardinality 求唯一值,即不重复的字段某些许

{
    "aggs" : {
        "author_count" : {
            "cardinality" : {
                "field" : "author"
            }
        }
    }
}

多值聚合

percentiles 求百分比

{
    "aggs" : {
        "load_time_outlier" : {
            "percentile_ranks" : {
                "field" : "load_time", 
                "values" : [15, 30]
            }
        }
    }
}

回到的结果包蕴三个值:

{
    ...

   "aggregations": {
      "load_time_outlier": {
         "values" : {
            "15": 92,
            "30": 100
         }
      }
   }
}

stats 统计

{
    "aggs" : {
        "grades_stats" : { "stats" : { "field" : "grade" } }
    }
}

恳请后会直接呈现各个相会结果:

{
    ...

    "aggregations": {
        "grades_stats": {
            "count": 6,
            "min": 60,
            "max": 98,
            "avg": 78.5,
            "sum": 471
        }
    }
}

extend stats 扩大计算

{
    "aggs" : {
        "grades_stats" : { "extended_stats" : { "field" : "grade" } }
    }
}

在总计的基础上还扩展了多样错综复杂的计算音信:

{
    ...

    "aggregations": {
        "grade_stats": {
           "count": 9,
           "min": 72,
           "max": 99,
           "avg": 86,
           "sum": 774,
           "sum_of_squares": 67028,
           "variance": 51.55555555555556,
           "std_deviation": 7.180219742846005,
           "std_deviation_bounds": {
            "upper": 100.36043948569201,
            "lower": 71.63956051430799
           }
        }
    }
}

总结

上面并从未列举周全,比如2.0本子的ES,还帮忙多值的percentile
Rank百分比排名,Geo Bounds地理地点信息,Scripted Metric脚本;单值的top
hits等等。

  • 在性质上,ES也做了不少的优化:比如max和min,假使对于排序的字段,那么就一向跳过了总括的手续,直接取出指标值即可。
  • 当然有个别聚合也是急需一定的场面的,比如cardinality计算唯一值是透过哈希的主意,若是字段数据规模相当大,那么会损耗过多的天性。
  • 别的桶里面是足以嵌套的,比如在range聚合下嵌套了三个max聚合,那么会在range获得的每一种结果组上,再度开始展览max的总结。
  • 在联谊中协理脚本的接纳,能够追加计算的灵活度。

很多剧情还供给在实践中使用,才能领悟它的优势。

相关文章