首页
学习
活动
专区
圈层
工具
发布
  • 您找到你想要的搜索结果了吗?
    是的
    没有找到

    Spark随笔 —— RDD 与 DataSet

    前言 本篇文章进对 RDD 和 DataSet 进行对比和总结。 当然因为随笔,所以想到哪写到哪... 哎~,最近变懒了,都不想动脑子了!!! RDD 和 DataSet 有什么关系?...随着 Spark 版本的不断迭代,已经在慢慢弱化 RDD的概念, 但是其实作为一个Spark 开发的程序员, RDD却是你绝对绕不过去的一个知识点, 而 DataSet 某种意义上来说其实是 RDD...更高等级的抽象, RDD 慢慢已经变成底层的东西了, 如果有一天,不是程序员也能随心编写Spark了, RDD可能就真的不为一般Spark使用者所知了。...更加简单易用,未来很可能只需要简单的培训就可以使用Spark, 而不需要专业的程序员 或者说 大数据工程师 才能用。好吧~全民分析,全民编程!

    88320

    TO_DATE函数索引报错ORA-01743

    鉴于数据量比较大,需要使用索引,那么很容易想到的是建立to_date(effdate,’DDMONYY’)的一个函数索引, ? 创建索引报错了,ORA-01743, ?...提示:“只能对纯粹的函数创建索引,SQL表达式不能使用任何依赖于当前session状态的信息”。从这SQL看,没有使用SYSDATE、USER、USERENV()这些函数,为什么还提示这错误?...It turns out that TO_DATE, when used with YYYY, is not deterministic!...原因就是TO_DATE函数中使用了表示年份的YY,对于格式相同的输入,返回的则是不同的结果,有些抽象,结合例子看下,假设今天是1月份,则如下SQL返回的是2010年1月1日(1月1日是因为未指定月日,则做了类似...之所以是结果不同,是因为TO_DATE使用了SYSDATE作为基准来输出的日期,因此SQL其实还是基于了session,所以TO_DATE函数索引会有ORA-01743。

    1.2K20

    Spark RDD Dataset 相关操作及对比汇总笔记

    本篇博客将会汇总记录大部分的Spark RDD / Dataset的常用操作以及一些容易混淆的操作对比。 0....基本概念 首先介绍一下基本概念,详情可以参考之前的博客: Spark 与 Hadoop 学习笔记 介绍及对比 Databrick 's Blog on Spark Structured Streaming...在这个数组上运用scala的函数式操作。Return all the elements of the dataset as an array at the driver program....整个过程如下: [70] 4.2 groupByKey 当采用groupByKey时,由于它不接收函数,spark只能先将所有的键值对(key-value pair)都移动,这样的后果是集群节点之间的开销很大...utm_source=blogxgwz1 https://spark.apache.org/docs/2.3.1/api/java/org/apache/spark/rdd/PairRDDFunctions.html

    2.4K31

    Spark RDD Dataset 相关操作及对比汇总笔记

    本篇博客将会汇总记录大部分的Spark RDD / Dataset的常用操作以及一些容易混淆的操作对比。 0....基本概念 首先介绍一下基本概念,详情可以参考之前的博客: Spark 与 Hadoop 学习笔记 介绍及对比 Databrick 's Blog on Spark Structured Streaming...在这个数组上运用scala的函数式操作。Return all the elements of the dataset as an array at the driver program....4.2 groupByKey 当采用groupByKey时,由于它不接收函数,spark只能先将所有的键值对(key-value pair)都移动,这样的后果是集群节点之间的开销很大,导致传输延时。...utm_source=blogxgwz1 https://spark.apache.org/docs/2.3.1/api/java/org/apache/spark/rdd/PairRDDFunctions.html

    1.6K10

    详解spark开窗函数

    1.什么是窗口函数 窗口函数(Window functions)又称分析函数或开窗函数,它允许你在不改变原始行的情况下,对一组相关的行(称为“窗口”)进行计算和分析。...函数:指具体使用什么函数,支持哪些函数见【函数列表】 空值选项(可选) over:代表开窗,固定格式; 分组方式(可选) 排序方式(可选)(上面语法来源于spark官方文档,语法表述为必选项,实际应用为可选...) 空值选项(可选) 窗口框架(可选):指明窗口的范围,从什么地方开始到什么地方结束 2.函数列表 支持开窗的函数列表,支持开窗函数分为:排序函数(Ranking Functions)、分析函数(Analytic...Functions)、聚合函数(Aggregate Functions) 2.1 排序函数 排序函数 描述 函数具体介绍 RANK 计算一组值中某个值的排名。...4.1聚合函数开窗的排序 聚合函数开窗可以排序也可以不排序。

    1.6K10

    源码:Spark SQL 分区特性第一弹

    头条号上说过近期分享Spark SQL系列文章,前面在头条号上分享了Dataset API的基本操作和复杂操作,不知道下面大家有没有自己测试一下。...今天主要是分享Spark SQL Dataset数据源的分区特性,而且是第一弹的数据格式是partquet。...这些都很简单,那么今天咱们要谈的是Spark DataSet的分区数的决定因素。...", "amount") 将Dataset存处为partquet格式的hive表,分两种情况: 用city和year字段分区 sales.write.partitionBy("city","year")...那么数据源生成的Dataset的分区数到底是如何决定的呢? 我们这种情况,我只能告诉你是由下面的函数在生成FileScanRDD的时候计算得到的,具体计算细节可以仔细阅读该函数。

    1.3K30
    领券