腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(3952)
视频
沙龙
1
回答
通过
bucketBy
实现
Spark
DataFrame
/
Dataset
groupBy
优化
apache-spark
、
group-by
、
query-optimization
、
parquet
、
bucket
我读过一些关于
groupBy
优化
的文章,但是没有找到太多关于它的信息(除了RDD级别的reduceByKey)。我所考虑的是,如果数据集是由键写成桶的,那么它也将在
groupBy
中使用。从理论上讲,
groupBy
是可以
优化
的,因为包含该键的所有行都将位于同一位置(如果它也按相同的键排序存储,甚至可以是连续的)。我脑海中的一个想法是
通过
mapPartitions然后
groupBy
来应用转换,然而,这将需要将我的函数一分为二,这并不是真正可取的。我相信对于某些类型的函数(比
浏览 61
提问于2019-05-18
得票数 3
1
回答
如何可靠地写入和恢复分区数据
apache-spark
对于这个问题,我可以接受两个分区的RDD和
Dataset
[Row] /
Dataframe
这样做的目的是为了在恢复数据时避免混洗例如: .repartition(m,
浏览 0
提问于2016-10-06
得票数 2
3
回答
Apache星火窗口函数,FIRST_VALUE不工作。
apache-spark
、
apache-spark-sql
、
aggregation
、
window-functions
;import org.apache.
spark
.sql.expressions.Window;import org.apache.
spark
.sql.types.DataTypes;importorg.apache.
spark</em
浏览 1
提问于2018-05-15
得票数 0
回答已采纳
1
回答
如何保存存储桶的
DataFrame
?
apache-spark
、
apache-spark-sql
我正在尝试使用
bucketBy
保存
dataFrame
但这会产生错误:有没有其他方法可以保存
bucketBy<
浏览 106
提问于2017-02-03
得票数 5
1
回答
使用Apache
Spark
重新分区
java
、
scala
、
hadoop
、
apache-spark
例如,如果我为每一行打印该列的每个值的模数,则在给定分区中得到相同的模块(我
通过
手动读取saveAsHadoopFile保存的内容来读取分区)。 它不像预期的那样使用最新的API。但是现在我正在尝试使用2.0.1API(在Scala中)和数据集,这些数据集有一个重新分区方法,它接受了许多分区和一个列,并将这个
DataSet
保存为一个parquet文件。
浏览 2
提问于2016-11-14
得票数 3
回答已采纳
1
回答
ReduceByKey CountByKey在
Spark
中不工作
python-3.x
、
apache-spark
我是
spark
的新手,我有一个任务,我试图提供一个输出,其中包含前两个部门名称和来自csv的大多数员工ID。lambda x, y : x + y).take(10) 然而,当我执行时,我得到了一个错误(当我执行AggretageByKey时,我也得到了类似的错误,所以我有点迷路了): org.apache.
spark
.SparkExceptionmost recent failure: org.apache.
sp
浏览 18
提问于2019-10-14
得票数 0
2
回答
火花数据集到数组的转换
arrays
、
apache-spark
、
apache-spark-sql
、
transformation
、
large-data
我有如下所示的数据集: col1值多次重复,col2值唯一。这个原始数据集可以有将近十亿行,所以我不想使用收集或collect_list,因为它不会为我的用例扩展。+---------------------|+---------------------|| BB| 21 || AA| 13 || CC| 33
浏览 1
提问于2020-06-24
得票数 0
回答已采纳
2
回答
DataSet
javaRDD()性能
java
、
performance
、
apache-spark
、
cassandra
、
apache-spark-sql
我正在使用
Spark
SQL从
Spark
应用程序的Cassandra中检索数据。数据以
DataSet
的形式检索。但是,我需要使用javaRDD()函数将此
dataset
转换为JavaRDD。
浏览 1
提问于2017-08-19
得票数 0
3
回答
Dataframe
API与
Spark
.sql [重复]
dataframe
、
apache-spark
、
catalyst-optimizer
这个问题在这里已经有答案了: 在
Spark
SQL中编写SQL与使用
Dataframe
API(4个答案) 4天前就关门了。用
Dataframe
API格式而不是
Spark
.sql查询编写代码有什么显著的优势吗? 我想知道催化剂
优化
器是否也会对
spark
.sql查询起作用。
浏览 103
提问于2021-02-25
得票数 0
回答已采纳
1
回答
如何对count的多个列使用group by?
scala
、
apache-spark-sql
我有一个名为tags(UserId,MovieId,Tag)的文件作为算法的输入,并
通过
registerTempTable将其转换为表格。/
dataset
/algorithm3/output")eachTagCount.rdd.map(_.toSeq.map(_+"").reduce(_+","+_)) .saveAsText
浏览 22
提问于2019-06-10
得票数 1
回答已采纳
3
回答
使用Java在
Spark
2.0中使用数据集的GroupByKey
java
、
apache-spark
、
group-by
、
dataset
、
apache-spark-2.0
有人能帮助我找到一个使用groupByKey的解决方案,或者使用任何其他转换和操作的组合来
通过
使用数据集而不是RDD来获得这个输出吗?
浏览 3
提问于2016-09-08
得票数 7
回答已采纳
1
回答
如何加载一个存储桶的
DataFrame
,以保留存储桶?
apache-spark
、
apache-spark-sql
我已经存储了一个数据帧,即
bucketBy
和saveAsTable。== Physical Plan/tab1], PartitionFilters: [], Push
浏览 1
提问于2017-10-18
得票数 4
1
回答
DataFrame
/
Dataset
groupBy
行为/
优化
performance
、
apache-spark
、
dataframe
、
apache-spark-sql
、
apache-spark-dataset
假设我们有由以下列组成的
DataFrame
df: val df2 = df.
groupBy
("surname").agg( sum("width")
浏览 3
提问于2015-10-02
得票数 37
回答已采纳
2
回答
星星之交*不洗牌
scala
、
apache-spark
我正在努力
优化
我的火花申请工作。 有可能吗?如果不存在类似的功能,我希望
实现
类似的内容。
浏览 1
提问于2018-12-08
得票数 4
回答已采纳
2
回答
星火知道
DataFrame
的分区键吗?
apache-spark
、
partitioning
、
window-functions
上下文:import org.apache.
spark
.sql.functions._ sum(col("dollars").over(w)) 在read之后,我可以看到repartition按预期工作,<e
浏览 0
提问于2018-01-26
得票数 21
回答已采纳
2
回答
对
Spark
数据帧/数据集进行有效连接的分区数据
apache-spark
、
apache-spark-sql
、
spark-dataframe
、
partitioning
、
apache-spark-dataset
同样的事情也可以在
Spark
DataFrames或DataSets上完成吗?
浏览 0
提问于2018-01-09
得票数 13
回答已采纳
1
回答
按星火数据帧所有列分组并计数
scala
、
apache-spark
、
group-by
、
apache-spark-sql
我希望使用
Spark
对数据帧的每一列执行Group。
Dataframe
将有大约。1000列。val df = sqlContext .format("org.apache.
spark
.sql.cassandra")", "keyspace" -> "testdata")) val
浏览 0
提问于2019-08-12
得票数 1
回答已采纳
1
回答
将
GroupBy
+aggregate转换为groupByKey
apache-spark
、
pyspark
、
spark-dataframe
|A |B ||2 |"bar/foo" |df.
groupby
("A").collect() 但是,由于我从事的是一个大型的DF,所以
groupby
+agg没有那么好,而且做了很多
浏览 0
提问于2017-08-07
得票数 1
回答已采纳
1
回答
如何计算数据文件中的记录数?
python
、
apache-spark
、
pyspark
我知道df.count()将触发火花操作并返回数据格式中的记录数,但我想知道这个过程在内部是如何工作的--
spark
是
通过
整个
dataframe
来计算记录数量的,还是还有其他
优化
的技术,比如在
dataframe
浏览 6
提问于2022-05-17
得票数 1
回答已采纳
2
回答
为什么在显示操作员之后不能加入?
scala
、
apache-spark
、
join
、
apache-spark-sql
val tempTableB = tableB.
groupBy
("idB")错误说: (right: org.apache.
spark
.sql.
Dataset
浏览 0
提问于2017-07-26
得票数 2
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
实时音视频
云点播
活动推荐
运营活动
广告
关闭
领券