腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
输出
分区
数
python
、
amazon-web-services
、
apache-spark
、
pyspark
、
aws-glue
假设在AWS Glue作业中,用户在日志中看到以下
输出
: 21/07/27 18:25:36 INFO DAGScheduler: Got job 1 (toPandas at /tmp/test.py:742) with 100000 output partitions Spark是否动态设置
输出
分区
的数量?有没有办法为特定的作业预先设置
输出
分区
的数量?
浏览 14
提问于2021-07-28
得票数 0
回答已采纳
1
回答
为什么星火数据框架显示不同的结果?
apache-spark
、
pyspark
、
apache-spark-sql
、
aws-glue
该语句
输出
partitionID和该
分区
中的记录
数
:data_frame.toDF().withColumn("partitionId", spark_partition_id()).groupBy("---------+-----++-----------+-----++-----------+-----+ 该语句
输出
分区
数
'Num partitions: %s&
浏览 4
提问于2022-10-19
得票数 0
1
回答
apache spark RDD sortBy方法中使用的
分区
数
是多少?
java
、
apache-spark
这种排序方法的
分区
数量是如何使用的?
浏览 1
提问于2018-03-28
得票数 0
1
回答
运行本地hadoop映射-还原不像预期的那样
分区
数据。
java
、
hadoop
、
mapreduce
我有一个地图减少程序,它计算每十年从谷歌ngram中发生的事件的数量。public static class PartitionerClass extends Partitioner<Bigram, IntWritable> { String combined=key.getFirst().toString()+key.getSecond().toString()+key.getDecade
浏览 1
提问于2017-03-01
得票数 0
回答已采纳
3
回答
最近
分区
数
code-golf
、
number-theory
、
integer-partitions
整数的
分区
数
是整数可以表示为正整数之和的方式
数
。如果输入不是
分区
号,则
输出
必须是两个不同的正整数,它们生成两个最接近输入号的
分区
号。(如果两个
分区
号相等于其中一个
输出
数字,那么您选择哪一个并不重要。)如果输入是
分区
号,则
输出
必须为生成输入号的1正整数。您可以假设输入不会超过1亿(例如。产量永远不会大于95)。 不允许与其他标准漏洞一起使用内置函数计算
分区
浏览 0
提问于2014-12-26
得票数 13
回答已采纳
2
回答
连接后的Dataframe保存正在创建许多部件文件。
apache-spark-sql
tech,mr sales,Sales of Captech,Tech staff控制台
输出
浏览 1
提问于2016-04-19
得票数 2
1
回答
如何查看impala表中的
分区
数量
impala
、
partition
是否可以在impala中查看表的
分区
总数? 例如,db.table有40.500个
分区
浏览 361
提问于2021-09-14
得票数 2
回答已采纳
1
回答
SparkError: XXXX任务序列化结果的总大小(2.0 GB)大于spark.driver.maxResultSize (2.0 GB)
scala
、
apache-spark
、
apache-spark-mllib
错误:目标:获得对所有使用该模型的用户的推荐,并与每个用户的测试数据重叠,生成重叠率。 def overlapRatio(model: MatrixFactorizationModel, test_data:
浏览 5
提问于2015-12-02
得票数 7
1
回答
洗牌
分区
与再
分区
的区别
apache-spark
、
partitioning
我是一个新手,在火花,我试图了解洗牌,
分区
和重新划分功能。但我还是不明白他们有什么不同。两者都减少了
分区
的数量?? 谢谢
浏览 7
提问于2022-06-09
得票数 0
2
回答
增加Goldbach
分区
code-golf
、
number-theory
、
decision-problem
、
primes
我们将考虑
数
n的Goldbach划分为两个素数相加到n的一对,我们关注的是关于增加Goldbach划分的
数
。我们用一个
数
的所有
分区
中最小素数的大小来度量一个数字的Goldbach
分区
的大小。如果一个数字的大小大于所有较小偶数的大小,则该数字的
分区
将不断增加。给定偶数n> 2,确定n是否为递增Goldbach
分区
,并
输出
两个唯一值,一个是如果是,另一个不是。
浏览 0
提问于2017-07-03
得票数 9
1
回答
Hadoop中的Map约简流
java
、
hadoop
、
mapreduce
、
pseudocode
我正在使用“Hadoop in Practice”一书学习Hadoop,在阅读第1章时,我看到了这个图表:来自Hadoop文档:() 虽然我理解shuffle和sorting同时发生,但我不
浏览 3
提问于2014-01-04
得票数 3
回答已采纳
2
回答
火花作业似乎只使用了少量的资源。
apache-spark
、
google-cloud-dataproc
请容忍我,因为我对火花还是很陌生的。集群为1+ 16,每节点8核/40 16 mem / 1TB存储。我使用了标志--executor-cores 4和--num-executors 6,这似乎没有什么区别。 有人能提供一些关于我如何微调这些工
浏览 1
提问于2019-06-25
得票数 2
回答已采纳
1
回答
dataFrameWriter partitionBy会对数据进行洗牌吗?
apache-spark
、
hadoop
、
apache-spark-sql
、
hdfs
、
partitioning
我用一种方式对数据进行了
分区
,我只想在另一种方式中对其进行
分区
。我想知道这是否会触发洗牌,还是所有数据都会在本地重新
分区
,因为在这种情况下,
分区
意味着HDFS中的一个目录,而来自同一个
分区
的数据不需要在同一个节点上才能在HDFS中用相同的dir写入。
浏览 3
提问于2016-10-01
得票数 2
回答已采纳
2
回答
在Dask数据文件中,n
分区
的作用是什么?
python
、
dataframe
、
dask
元素仅从第一个n
分区
中提取,默认值为1。如果第一个n
分区
中有少于n行,则会引发警告,并返回找到的任何行。传递-1以使用所有
分区
。
输出
的
分区
数
,必须小于输入的n个
分区
。在本例中,
分区
的数目可能是5个: (图片来源: )
浏览 5
提问于2017-10-09
得票数 17
回答已采纳
3
回答
可以合并增加星火DataFrame的
分区
吗
apache-spark
、
apache-spark-sql
、
apache-spark-sql-repartition
如果我正确地理解了,coalesce()只能减少数据帧的
分区
数
,如果我们试图增加
分区
的数量,那么
分区
的数量将保持不变。但是当我试图执行下面的代码时,我观察到了两件事是否意味着通过合并可以增加数据
分区
?println("Coalesced dataframe with increased partitions = "
浏览 4
提问于2019-09-27
得票数 3
1
回答
找到那个不。关于求所有正整数小于n的和n的方法
algorithm
、
math
、
series
对于给定的
数
n,假设2我们可以用
数
减去2得到和2。so, for 2 - just 1 way.
浏览 3
提问于2011-11-19
得票数 7
3
回答
火花再
分区
执行器
python
、
scala
、
apache-spark
、
pyspark
、
partitioning
为了避免
分区
内的小块,我添加了一个重
分区
(5),以便在每个
分区
中最多有5个文件:我在这里的问题是,在我分配的30个执行程序中,只有最后,我得到了我想要的(每个
分区
中有5个文件),但是由于只有5个执行程序在运行,所以执行时间非常长。 你对我如何让它更快有什么建议吗?
浏览 7
提问于2020-07-29
得票数 2
回答已采纳
1
回答
Dask Dataframe -小型数据帧的多个任务/
分区
python
、
pandas
、
dataframe
、
dask
分区
的数量是81,这似乎太高了。我把它降到了5个小时,还是花了4个小时。
浏览 19
提问于2020-05-01
得票数 1
1
回答
如何在使用PySpark将数据写入拼图时指定
分区
号
apache-spark
、
pyspark
我想写一个火花数据,但不是指定为partitionBy,而是numPartitions或每个
分区
的大小。在PySpark中有一种简单的方法吗?
浏览 0
提问于2016-05-08
得票数 4
回答已采纳
3
回答
如何在Spark SQL中控制
分区
大小
apache-spark
、
hive
、
apache-spark-sql
、
partitioning
默认情况下,DataFrame from SQL output有2个
分区
。为了获得更多的并行性,我需要SQL之外的更多
分区
。在HiveContext中没有重载方法来获取
分区
数
参数。RDD的重新
分区
会导致混洗,并导致更多的处理时间。val result = sqlContext.sql("select * from bt_st_ent")Starting task 0.0 in stage 131.0 (TIDtask 1.0 in stage 1
浏览 1
提问于2016-07-07
得票数 24
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
实时音视频
活动推荐
运营活动
广告
关闭
领券