函数
函数名 | 功能描述 |
COUNT([ ALL ] expression | DISTINCT expression1 [, expression2]*) | 默认情况和 ALL 时,返回 expression 表达式筛选后,非 NULL 值的输入行数。如果是 DISTINCT,则会先对数据进行去重,然后再进行统计总行数。 |
COUNT(*) COUNT(1) | 返回输入的总行数,含 NULL 值。 |
AVG([ ALL | DISTINCT ] expression) | 默认情况和 ALL 时,返回 expression 表达式筛选后,所有输入的算术平均值。如果是 DISTINCT,则会先对数据进行去重,然后再进行统计求平均。 |
SUM([ ALL | DISTINCT ] expression) | 默认情况和 ALL 时,返回 expression 表达式筛选后,所有输入的和。如果是 DISTINCT,则会先对数据进行去重,然后再进行统计求和。 |
MAX([ ALL | DISTINCT ] expression) | 默认情况和 ALL 时,返回 expression 表达式筛选后,所有输入的最大值(不可用于 TIMESTAMP 类型)。如果是 DISTINCT,则会先对数据进行去重,然后再进行统计求最大值。 |
MIN([ ALL | DISTINCT ] expression) | 默认情况和 ALL 时,返回 expression 表达式筛选后,所有输入的最小值(不可用于 TIMESTAMP 类型)。如果是 DISTINCT,则会先对数据进行去重,然后再进行统计求最小值。 |
STDDEV_POP([ ALL | DISTINCT ] expression) | 默认情况和 ALL 时,返回 expression 表达式筛选后,所有输入的总体标准差。如果是 DISTINCT,则会先对数据进行去重,然后再进行统计求总体标准差。 |
STDDEV_SAMP([ ALL | DISTINCT ] expression) | 默认情况和 ALL 时,返回 expression 表达式筛选后,所有输入的样本标准差。如果是 DISTINCT,则会先对数据进行去重,然后再进行统计求样本标准差。 |
VAR_POP([ ALL | DISTINCT ] expression) | 默认情况和 ALL 时,返回 expression 表达式筛选后,所有输入的总体方差。如果是 DISTINCT,则会先对数据进行去重,然后再进行统计求总体方差。 |
VAR_SAMP([ ALL | DISTINCT ] expression) VARIANCE([ ALL | DISTINCT ] expression) | 默认情况和 ALL 时,返回 expression 表达式筛选后,所有输入的样本方差。如果是 DISTINCT,则会先对数据进行去重,然后再进行统计求样本方差。两种写法等价。 |
COLLECT([ ALL | DISTINCT ] expression) | 默认情况和 ALL 时,返回 expression 表达式筛选后,所有输入的非 NULL 输入的 MULTISET 集合(允许重复值)。如果所有值都是 NULL,则返回一个空集。 |
RANK() | 返回某个数据在一组数据中的排名,前后调用的结果可能不连续。例如有五个数据,其中两个并列第二,那么 RANK() 的结果是1、2、2、4、5。 |
DENSE_RANK() | 返回某个数据在一组数据中的排名,前后调用的结果保证连续。例如有五个数据,其中两个并列第二,那么 RANK() 的结果是1、2、2、3、4。 |
ROW_NUMBER() | 为一组数据的每行分配一个递增且连续的值,从1开始,不会重复。例如有五个数据,其中两个并列第二,那么 RANK() 的结果是1、2、3、4、5。 |
LEAD(expression [, offset] [, default] ) | 在窗口计算中,访问当前行之后 offset 行的数据,默认 offset 为1,即访问下一行的数据。default 表示无数据时的默认值,如果不提供,默认为 NULL。 |
LAG(expression [, offset] [, default]) | 在窗口计算中,访问当前行之前 offset 行的数据,默认 offset 为1,即访问上一行的数据。default 表示无数据时的默认值,如果不提供,默认为 NULL。 |
FIRST_VALUE(expression) | 返回一系列数据中,第一个数据。 |
LAST_VALUE(expression) | 返回一系列数据中,最后一个数据。 |
LISTAGG(expression [, separator]) | 将一组数据使用给定的分隔符进行连接,最终返回一个连接后的字符串。默认分隔符是半角逗号 ,。类似于其他语言的 String.join() 方法。 |
PERCENTILE(expr, percentage) PERCENTILE(expr, percentage, frequency) | 用于计算一组数值在指定百分位(分位数)上的取值,采用线性插值算法(与 SQL 标准 PERCENTILE_CONT 语义一致)。支持传入百分位数组一次性计算多个分位数,也支持通过 frequency 参数指定每个取值的重复次数(频数),适用于延迟、耗时、水位等分布统计场景。 |
示例
为方便演示,建立示例测试数据表 Test:
id | site_id | count | date |
1 | 1 | 45 | 2021-07-10 |
2 | 3 | 100 | 2021-07-13 |
3 | 1 | 230 | 2021-07-14 |
4 | 2 | 10 | 2021-07-14 |
5 | 5 | 205 | 2021-07-14 |
6 | 4 | 13 | 2021-07-15 |
7 | 3 | 220 | 2021-07-15 |
8 | 5 | 545 | 2021-07-16 |
9 | 3 | 201 | 2021-07-17 |
COUNT
功能描述:统计总行数。
语法:COUNT([ ALL ] expression | DISTINCT expression1 [, expression2] * )
示例测试语句:
SELECT COUNT(*) FROM Test;测试结果:测试语句 | 测试结果(nums) |
SELECT COUNT(*) AS nums FROM Test; | 9 |
SELECT COUNT(DISTINCT site_id) AS nums FROM Test; | 5 |
AVG
功能描述: 统计求平均。
语法:AVG([ ALL | DISTINCT ] expression)
示例测试语句: SELECT AVG(count) FROM Test;
测试数据和结果:
测试语句 | 测试结果(nums) |
SELECT AVG(count) AS nums FROM Test; | 176.3 |
SUM
功能描述:统计求和。
语法: SUM([ ALL | DISTINCT ] expression)
示例测试语句: SELECT SUM(count) FROM Test;
测试数据和结果:
测试语句 | 测试结果(nums) |
SELECT SUM(count) AS nums FROM Test; | 1569 |
MAX
功能描述:统计求最大值。
语法: MAX([ ALL | DISTINCT ] expression)
示例测试语句: SELECT MAX(count) FROM Test;
测试数据和结果:
测试语句 | 测试结果(nums) |
SELECT MAX(count) AS nums FROM Test; | 545 |
MIN
功能描述:统计求最小值。
语法: MIN([ ALL | DISTINCT ] expression)
示例测试语句: SELECT MIN(count) FROM Test;
测试数据和结果:
测试语句 | 测试结果(nums) |
SELECT MIN(count) AS nums FROM Test; | 13 |
STDDEV_POP
功能描述:统计求总体标准差。
语法: STDDEV_POP([ ALL | DISTINCT ] expression)
示例测试语句: SELECT STDDEV_POP(count) FROM Test;
测试数据和结果:
测试语句 | 测试结果(pop) |
SELECT STDDEV_POP(count) AS pop FROM Test; | 156.18 |
VAR_POP
功能描述:统计求总体方差。
语法: VAR_POP([ ALL | DISTINCT ] expression)
示例测试语句: SELECT VAR_POP(count) FROM Test;
测试数据和结果:
测试语句 | 测试结果(pop) |
SELECT VAR_POP(count) AS pop FROM Test; | 24390.7 |
FIRST_VALUE
功能描述:返回一系列数据中,第一个数据。
语法: FIRST_VALUE(expression)
示例测试语句: SELECT FIRST_VALUE(count) FROM Test;
测试数据和结果:
测试语句 | 测试结果(first) |
SELECT FIRST_VALUE(count) AS first FROM Test; | 45 |
LAST_VALUE
功能描述:返回一系列数据中,最后一个数据。
语法: LAST_VALUE(expression)
示例测试语句: SELECT LAST_VALUE(count) FROM Test;
测试数据和结果:
测试语句 | 测试结果(last) |
SELECT LAST_VALUE(count) AS last FROM Test; | 201 |
PERCENTILE
支持版本:仅 1.20 及以上版本支持。
功能描述:PERCENTILE 是聚合函数,用于计算一组数值在指定百分位(分位数)上的取值,采用线性插值算法(与 SQL 标准 PERCENTILE_CONT 语义一致)。支持传入百分位数组一次性计算多个分位数,也支持通过 frequency 参数指定每个取值的重复次数(频数),适用于延迟、耗时、水位等分布统计场景。
语法:
PERCENTILE(expr, percentage)
PERCENTILE(expr, percentage, frequency)
参数说明:
参数 | 类型 | 是否必填 | 说明 |
expr | NUMERIC(TINYINT / SMALLINT / INT / BIGINT / FLOAT / DOUBLE / DECIMAL) | 是 | 参与百分位计算的数值表达式。值为 NULL 的行不参与计算。 |
percentage | NUMERIC 或 ARRAY | 是 | 目标百分位,取值范围 [0.0, 1.0],不可为 NULL。传单个数值时返回 DOUBLE;传数组时一次性计算多个百分位,返回 ARRAY。该参数在每个分组内只取第一条数据的值,应使用常量表达式(如 0.95 或 ARRAY[0.5, 0.9, 0.99])。 |
frequency | INTEGER_NUMERIC(TINYINT / SMALLINT / INT / BIGINT) | 否 | 每个 expr 取值的重复次数(频数),不传时默认为 1。为 NULL 或小于等于 0 时,该行不参与计算。 |
返回值:
返回类型 | 说明 |
DOUBLE | percentage 为单个数值时,返回对应百分位的计算结果。无论 expr 原始类型是什么(如 INT、DECIMAL),返回值均为 DOUBLE。分组内无有效数据时返回 NULL。 |
ARRAY | percentage 为数组时,返回与各百分位一一对应的结果数组,顺序与输入数组一致。percentage 为空数组或分组内无有效数据时返回 NULL。 |
错误与空值语义:
场景 | 行为 |
expr 为 NULL | 该行不参与计算 |
frequency 为 NULL 或 ≤ 0 | 该行不参与计算 |
分组内无有效数据 | 返回 NULL |
percentage 为空数组 | 返回 NULL |
percentage 超出 [0.0, 1.0](常量) | SQL 校验失败,作业无法启动 |
percentage 超出 [0.0, 1.0](非常量表达式) | 运行时抛出 IllegalArgumentException: Percentage of PERCENTILE should be between [0.0, 1.0] |
示例:
CREATE TABLE test_source (age INT) WITH ('connector' = 'datagen','fields.age.kind' = 'sequence','fields.age.start' = '10','fields.age.end' = '1000','rows-per-second' = '1');CREATE TABLE logger_sink (p25 DOUBLE,p50 DOUBLE,p75 DOUBLE,percent1 DOUBLE) WITH ('connector' = 'logger','print-identifier' = 'DebugData');INSERT INTOlogger_sinkSELECTT1.p25,T1.p50,T1.p75,T1.percentiles [1] AS percent1FROM(SELECTPERCENTILE(age, 0.25) AS p25, -- 标量形式PERCENTILE(age, 0.50) AS p50,PERCENTILE(age, 0.75) AS p75,PERCENTILE(age, ARRAY [0.9, 0.7, 0.3, 1.0]) AS percentiles -- 数组形式FROMtest_source) T1;