腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
SparkSql
列
移位
问题
sql
、
python-3.x
、
pyspark
、
apache-spark-sql
keywordList, from psyc""").show(15) 我在
列
随机显示的一行中得到了奇怪的结果我检查了CSV文件中不同
列
中的唯一值,这些
列
不包含这些值。
浏览 32
提问于2020-01-28
得票数 0
1
回答
将具有动态柱的CSV转换为拼图
csv
、
apache-spark
、
parquet
我有一个表的csv文件,该表包含顺序不确定的动态
列
:name, id, age, jobcsv文件2:002, PMBrandonspark.read.csv(input_path, header = True).write.parquet(output_path) 当我使用
sparksql
读取拼花时,数据已被
移位
。当涉及到重新排序时,它应该能够按列名写入到parquet,这样数据就不会
移位</e
浏览 6
提问于2020-06-04
得票数 0
3
回答
用Spark和Scala清洗尺寸~40 of的CSV/Dataframe
scala
、
csv
、
apache-spark
、
apache-spark-sql
、
apache-spark-dataset
我有一个初始的CSV,它的数据大小为~40 in,但是以某种
移位
的顺序。我的意思是,如果你看到最初的CSV,因为珍妮没有年龄,所以性别
列
值被移到年龄,剩下的
列
值一直移动到行中的最后一个元素。如果有人可以建议我一些逻辑或API,这是可以用一个更干净的方式解决这个
问题
。我可能不需要适当的解决方案,但指针也可以。帮助非常感激!!初始CSV/Dataframe需要CSV/Dataframe编辑:val spark = SparkSession .builder .
浏览 0
提问于2019-09-12
得票数 1
1
回答
在scala中读取spark.structType
scala
、
struct
、
apache-spark
我正在运行以下scala代码:val df=hiveContext.sql("SELECT * FROM hl7.all_index")val firstStruct=rows.first.get(4)val fs=firstStruct.asInstanceOf[StructType]//w
浏览 1
提问于2016-06-16
得票数 0
1
回答
apache方解石和teradata中的SQL查询
hadoop
、
apache-spark
、
teradata
、
apache-calcite
问题
是,如果我们定义一个派生变量(AS),并试图在相同级别的同一查询中使用它,那么它在
SparkSQL
和方解石中不起作用,而是在Teradata中工作。case when sum_dept > 10 then 1 else 0 end as tmp group by EMPNO; => WORKS in Teradata 在执行SQL“选择EMPNO,sum(deptno)作为sum_dept,当sum_dept > 10,则其他0结束为来自emps组的tmp”
浏览 1
提问于2018-01-26
得票数 2
回答已采纳
2
回答
火花的最大和最小
apache-spark
、
pyspark
、
apache-spark-sql
、
pyspark-sql
我是Spark新手,我对
SparkSQL
中的聚合函数MAX和MIN有一些疑问例如,对于给定的包含
列
time、value和label的数据帧,如何获取包含按label分组的time的MIN(Value) 谢谢。
浏览 2
提问于2016-03-17
得票数 0
2
回答
仅使用spark sql删除表/视图中的
列
apache-spark
、
apache-spark-sql
、
string-interpolation
我在一个表中有30
列
,即table_old drop_column=now_current_column 但它的抛出错误 mismatched input expecting '
浏览 7
提问于2018-11-01
得票数 3
1
回答
使用spark-sql或pyspark模式在
列
之间匹配的转换
azure
、
tsql
、
pyspark
、
apache-spark-sql
我有一个
问题
声明,所有的
列
类型都是字符串 ?
列
A模式如果它与
列
C中的模式匹配,则用1更新好的东西,否则(-) pyspark、
sparksql
中的任何查询 感谢Anuj Gupta
浏览 8
提问于2021-11-09
得票数 0
回答已采纳
1
回答
SparkSQL
无法运行简单的SQL查询。
sql
、
select
、
apache-spark-sql
我正在处理一个简单的
SparkSQL
查询: *,FROMWHERE7235;10973;931013;154416;48;3217.00;"A" 这个查询使用的是SQLite (这意味着添加了
列
EXPIRY_MONTH并在条件EXPIRY_MONTH >= 12上过滤数据),而不是<e
浏览 7
提问于2021-12-16
得票数 0
1
回答
如何在
SparkSQL
中模拟ZEROIFNULL的功能
apache-spark
、
pyspark
、
apache-spark-sql
Teradata有一个名为ZEROIFNULL的函数,它执行名称建议的操作,如果
列
的值为NULL,则返回零。在类似的行中,还有一个名为NULLIFZERO的函数。我想在
SparkSQL
中模拟/模拟这些功能(而不是使用dataframe或RDD,而是在
SparkSQL
中使用它们,在这里直接传递SQL)。 有什么想法吗?
浏览 1
提问于2018-01-25
得票数 2
回答已采纳
1
回答
sparkRDD和大文件比较
python
、
json
、
apache-spark
、
pyspark
场景:我有85789142个JSON文档和一个包含32227957个项目的文本文件。url1url3{"key1":"value1","key2":"value2","url":"some_url"}我做了什么:textfile_rdd = sc.textFile("path/to/textfile.txt") urls = set(textf
浏览 1
提问于2016-06-01
得票数 0
1
回答
在
SparkSQL
中使用Avro模式和Parquet格式进行读写
apache-spark
、
apache-spark-sql
、
avro
、
parquet
我正在尝试从
SparkSQL
中写入和读取镶木面板文件。出于模式演变的原因,我希望在写入和读取时使用Avro模式。但是,我想使用
SparkSQL
的write()和read()方法(它们与DataFrameWriter和DataFrameReader一起工作),它们与
SparkSQL
很好地集成在一起(我将编写和读取Dataset
SparkSQL
拼接格式似乎只支持“压缩”和"mergeSchema“选项--也就是说,没有用于指定替代模式格式或替代模式的选项。换句话说,似乎没有办法通过Avro模式使用
SparkS
浏览 1
提问于2017-01-04
得票数 5
1
回答
Pyspark
sparkSql
问题
python
、
sql
、
hadoop
、
apache-spark
我使用的是cloudera vm 10.0,spark版本为1.6。sqlContext.sql("select * from /user/hive/warehouse/default.party").show()Traceback (most recent call last): File "/usr/lib/spark/python/pyspark/
浏览 2
提问于2017-07-03
得票数 0
1
回答
SparkSQL
中的“谓词中不允许关联
列
”
sql
、
apache-spark-sql
、
databricks
、
azure-databricks
、
predicate
我遇到了将SQL存储过程迁移到
SparkSQL
的
问题
。我在Databricks中得到了这个错误:WITH CTE_1 SELECT id, Date, ......= (SELECT MIN(Date) FROM CTE_1)) FROM CTE_2 在
SparkSQL
中设置这一设置的最佳方法是什么?
浏览 0
提问于2022-07-26
得票数 2
1
回答
斯卡拉2.10.4至2.11的火花
scala
、
eclipse-plugin
、
apache-spark
、
apache-spark-sql
我需要使用超过22
列
宽的表来处理
SparkSQL
。在如何升级和可能的跨版本工作方面有帮助吗?我在eclipse中使用Scala,但是由于SchemaRDD的
问题
,我可以迁移到Intellij。 任何帮助都是非常感谢的。
浏览 0
提问于2015-02-09
得票数 1
1
回答
使用几个GBs大小的数据集的
sparksql
postgresql
、
apache-spark
、
apache-spark-sql
我没有在网上或其他
问题
上找到这个
问题
的答案,所以我在这里尝试:我读到
sparkSQL
打算在大型数据集上运行。什么时候选择
sparkSQL
而不是postgresSQL ?
浏览 2
提问于2021-01-04
得票数 1
回答已采纳
1
回答
通过集群提高
SparkSQL
查询性能
apache-spark-sql
我是
SparkSQL
新手,我主要负责编写
SparkSQL
查询。我们经常需要在查询中使用JOIN大表,并且不需要很长时间就会遇到与它们相关的性能
问题
(例如。Joins、aggregates等)。在网上搜索补救方法时,我最近遇到了一些术语-- COALESCE()、REPARTITION()、DISTRIBUTE BY、CLUSTER BY等,而且它们可能用于提高慢速运行的
SparkSQL
查询的性能有谁能在这里帮助我,并提供
SparkSQL
查询它们的用法和何时使用它们的例子?例如。syntaxhint sy
浏览 5
提问于2020-06-05
得票数 0
1
回答
SparkSQL
连接
问题
mysql
、
apache-spark
、
apache-spark-sql
我有一个火花作业,它将从CSV文件中的数据加载到MySQL数据库中。这将不会为每个插入打开一个连接。如果需要处理1K记录,这是很好的,但是当您处理数十亿条记录时,需要大量的资源。
浏览 1
提问于2018-07-24
得票数 1
回答已采纳
3
回答
Spark SQL语句
scala
、
apache-spark
、
apache-spark-sql
如何在一个范围内找到薪水?下面是我的代码,用于查找10000到20000年间的薪资:我认为应该有一个使用between的替代解决方案。如何使用between方法?
浏览 1
提问于2018-10-12
得票数 0
回答已采纳
点击加载更多
相关
资讯
经典算法(一)-最大子列和问题
全兼容的多列均匀布局问题
从下料问题看整数规划中的列生成方法
css table布局大法,解决你大部分居中、多列等高、左右布局的问题
从零到壹学习密码学第八讲:AES加密算法原理
热门
标签
更多标签
云服务器
ICP备案
对象存储
实时音视频
即时通信 IM
活动推荐
运营活动
广告
关闭
领券