腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
1
回答
使用
spark-SQL
获取
JSON
数据
json
、
apache-spark
、
apache-spark-sql
、
spark-dataframe
当我尝试
使用
Spark-SQL
查询
获取
嵌套的
JSON
数据
时:SQLContext sqlContext = new SQLContext(sc); DataFrame df = sqlContext.read().
json
("path_to_s3Except
浏览 13
提问于2017-02-08
得票数 0
5
回答
在spark dataframe中创建子字符串列
scala
、
apache-spark
、
spark-dataframe
我想要
获取
一个
json
文件并对其进行映射,以便其中一列是另一列的子字符串。------| -> |------------|---------| |hello, world| |hello, world| hello | 我可以
使用
spark-sql
语法来实现这一点,但是如何
使用
内置函数来实现呢?
浏览 59
提问于2017-03-16
得票数 15
回答已采纳
1
回答
火花壳和火花sql有什么区别?表现有什么不同吗?
apache-spark
、
apache-spark-sql
Queries are expressed in HiveQL
spark-sql
并查询蜂箱中的现有
数据
。 我想知道这两者的区别..。在spark中处理任何查询是否与火花-shell中的查询相同?我的意思是,我们能在星星之火-sql中充分利用火花的性能优势吗?
浏览 7
提问于2017-05-01
得票数 6
回答已采纳
1
回答
rdbms与spark sql之间的差异
apache-spark
、
rdbms
、
query-performance
、
apache-spark-sql
我正在
使用
Apache-Spark,在我的项目中,我想
使用
Spark-SQL
。但是,我必须确保
Spark-SQL
的查询性能。我知道
Spark-SQL
不像RDBMS那样有效。但是我想知道在
Spark-SQL
和RDBMS查询之间有太多的时间差距吗? 例如,我正在
使用
具有4 gb内存和1核CPU的虚拟机。这是一个很慢的系统。我有一个很小的
数据
集,有两个表。在这个硬件上
使用
Spark-SQL
正常吗?如果我用RDBMS做同样的
浏览 2
提问于2015-08-04
得票数 1
2
回答
Spark忽略查询中的命名空间
sql
、
apache-spark-sql
、
common-table-expression
、
databricks
如果我在查询中
使用
spark-sql
,然后
使用
不正确的命名空间/
数据
库引用CTE,则查询工作正常(意外)。当我在生产中运行查询时(在Databricks上),我会得到一个表或视图未找到错误(预期)。意外的传递行为可以通过
spark-sql
在本地复制。从终端复制的确切步骤:... > SELECT *F
浏览 1
提问于2020-07-15
得票数 1
回答已采纳
1
回答
当分区列倾斜时,更高效地写入分区拼图
sql
、
apache-spark
、
partitioning
、
skew
我正在编写一个大表(大约1.2b行),我
使用
state (如US state)作为分区键。问题是有大量的空状态值。
浏览 17
提问于2019-07-11
得票数 0
1
回答
将非严格的
JSON
Amazon SNAP元
数据
转换为Pandas DataFrame
python-2.7
、
pandas
、
apache-spark
、
ibm-cloud
我正在尝试在IBM Bluemix (
使用
Python2.x)中将转换为Pandas
数据
帧,然后
使用
Apache Spark对其进行分析。我已经解压了
JSON
文件并将其上传到Apache Spark Container。', 'tenantId':'s31d-8e24c13d9c36f4-43b43b7b993d'然后,我
使用
Apache Spark的示例将
浏览 2
提问于2016-08-18
得票数 1
3
回答
我们应该什么时候
使用
Spark-sql
,什么时候
使用
Spark RDD
apache-spark
、
pyspark
、
apache-spark-sql
、
rdd
在哪种场景下,我们应该更倾向于
使用
spark RDD来编写解决方案,在哪种场景下,我们应该选择
使用
spark-sql
。我知道
spark-sql
提供了更好的性能,它对结构和半结构
数据
的处理效果最好。但是,在选择spark Rdd和
spark-sql
时,我们还需要考虑哪些因素。
浏览 1
提问于2020-05-29
得票数 0
1
回答
Spark-SQL
数据
帧外部
数据
源效率低
apache-spark
、
apache-spark-sql
当我试图在
Spark-SQL
外部
数据
源上做一些测试时,会发生这个问题。为了更清楚地表达这个问题,我编写了一段代码: 在我的外部Datasource API基准代码中,它实现了一个假的外部
数据
源(实际上是一个RDD[String,ArrayInt] ),并通过以下方式
获取</em
浏览 2
提问于2016-01-09
得票数 1
1
回答
使用
org.apache.spark.sql.
json
选项在Spark sql中创建临时视图
google-cloud-platform
、
apache-spark-sql
我在谷歌存储桶里有一些
数据
。它是
Json
格式的,起源于Kafka。我想在存储桶的顶部用
spark-sql
创建一个临时视图。我试着这样做现在我只能访问
spark-sql
shell。下面的答案指向
使用
我无法访问的scala环境。请帮帮忙。谢谢
浏览 13
提问于2021-02-24
得票数 0
2
回答
如何
使用
spark
获取
配置单元分区列名
apache-spark
、
hive
创建按( col1 string,col2 bigint,col3 string,col4 string)分区的表ABC( Bigint string) 我有一个要求,我必须
使用
spark scala将
浏览 3
提问于2018-07-26
得票数 2
1
回答
如何
使用
纯spark sql查询CSV
apache-spark-sql
、
command-line-interface
我希望从
spark-sql
CLI获得输出。但是
数据
在CSV中,用"\t“分隔。有没有办法
使用
纯sql来做到这一点?cmd like:
spark-sql
-e 'select * from csv.`xxx` where xxx=xxx' 唯一的方法是先创建一个临时视图,然后再查询该视图?
浏览 33
提问于2020-09-18
得票数 1
2
回答
如何删除流
数据
中的重复项?
apache-spark
、
apache-spark-sql
、
spark-structured-streaming
我正在
使用
spark-sql
2.4.1结构化流与kafka,java8。例如,我的
数据
集如下所示我需要找出基于ColA ColB ColC的副本,取其中基于ColDate的最新副本,并删除其余的。也就是说,从上面的
数据
结果应该是如何
使用
spark streaming来实现?也就是说,我将在流中
获取
数据
,例如...不确定何时出现重复,如果按照前面指定的逻辑重复,我需要删除记录。
浏览 2
提问于2019-08-06
得票数 0
1
回答
在spark scala中编写嵌套
JSON
json
、
scala
、
apache-spark
、
apache-spark-sql
我的
Spark-SQL
通过连接两个具有一对多基数的表来生成查询的输出。我必须将
数据
转换为
JSON
。这就是查询的输出结果。| US | NewYork上述
数据
必须以这种方式转换为
JSON
。
浏览 1
提问于2016-03-31
得票数 1
0
回答
Object sql不是package org.apache.spark的成员
sql
、
scala
、
apache-spark
、
sbt
、
apache-spark-sql
我正在尝试
使用
spark-sql
,但在导入时
获取
以下错误:以下是我的详细信息: libraryDependencies +=
浏览 3
提问于2017-12-06
得票数 2
1
回答
任务失败
scala
、
sbt
当我在SBT构建系统中
使用
星星之火与Scala一起读取
Json
文件时,出现了以下错误: 我的SBT文件是: // https://mvnrepository.com/artifact/org.apache.spark/
浏览 14
提问于2022-11-11
得票数 0
1
回答
数据
库环境中的SparkSessionExtensions injectFunction
apache-spark
、
apache-spark-sql
、
databricks
、
databricks-community-edition
SparkSessionExtensions injectFunction可以在本地运行,但我不能让它在
数据
库环境中运行。项目定义了Catalyst表达式,比如我可以通过
spark-sql
在本地成功
使用
的age
spark-sql<
浏览 22
提问于2021-03-20
得票数 1
1
回答
Spark-Sql
自定义元存储
apache-spark-sql
、
hive-metastore
在HIVE中,我们可以将不同的RDBMs设置为元存储,并让HIVE在其中存储所有元
数据
。除此之外,通过hiveserver2,我们可以让HIVE监听请求并为其提供服务。同样,有许多文档说
Spark-SQL
也可以以类似的方式
使用
。我们可以将Oracle (一个例子)设置为
Spark-Sql
的元存储吗?如果是的话,有没有人可以帮我设置一下? 谢谢!
浏览 32
提问于2021-07-31
得票数 0
回答已采纳
2
回答
saveAsTable -如何向现有表中插入新
数据
?
apache-spark
、
pyspark
、
apache-spark-sql
、
pyspark-sql
如何向现有表中插入新
数据
?from pyspark.sql import SQLContext, DataFrameWriter sqlContext = SQLContext(sc) df = sqlContext.read.
json
("people.
json</e
浏览 0
提问于2018-11-08
得票数 3
1
回答
Spark& GeoMesa中地理空间表的左半连接
apache-spark-sql
、
geospatial
、
geomesa
包含地理空间点.我想执行以下查询:我
使用
Spark-SQL
和GeoMesa & Accumulo来实现同样的功能。(Spark作为处理引擎,Accumulo作为
数据
存储库& GeoMesa用于GeoSpatial库)。上面的查询是某种left semi join,但我不确定如何
使用
Spark-SQL
实现它,因为就我所读到
浏览 3
提问于2017-03-23
得票数 0
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
实时音视频
活动推荐
运营活动
广告
关闭
领券