腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(9999+)
视频
沙龙
0
回答
Spark
dataframe
过滤
空
值
和
空格
scala
、
apache-spark-sql
我有一个
spark
dataframe
,需要为它
过滤
特定列的
空
值
和
空格
。1 abc3 null5 def 我想要应用一个
过滤
器来
过滤
掉那些col2为nulls或空白的记录。版本:
Spark
1.6.2 Scala
浏览 16
提问于2016-12-31
得票数 3
回答已采纳
2
回答
Spark
2.0,
DataFrame
,筛选字符串列,不等运算符(!==)已弃用
apache-spark
、
spark-dataframe
我正在尝试
过滤
DataFrame
,只保留那些具有特定字符串列的行不为
空
。df.filter($"stringColumn" !== "")如何检查
Spark
> 2.0中的字符串列
值
是否为
空
?
浏览 1
提问于2016-10-20
得票数 22
回答已采纳
1
回答
过滤
掉null字符串
和
空字符串insparksql
apache-spark-sql
好的,我有一些数据,我想
过滤
掉所有的
空
值
和
空
值
。因此,我使用简单的sql命令首先
过滤
掉
空
值
。org.apache.
spark
.sql.
DataFrame
= [username: array<string>]| [null]| | [null]|有没有办法
过滤
掉这个空条目,并通过使用sparksql
过滤
掉所
浏览 4
提问于2016-04-29
得票数 3
1
回答
将
Spark
DataFrame
过滤
器与列名列表一起使用
scala
、
apache-spark
、
apache-spark-sql
我必须使用List[String]
过滤
Spark
DataFrame
中的非
空
列
值
val keyList = List("columnA", "columnB", "columnC", "columnD对于名为key的单个列,语法应为: val nonNullDf = df.filter(col("key").isNotNull) 我的问题是如何在前面的
过滤
器中使用keyList?
浏览 16
提问于2021-04-19
得票数 1
回答已采纳
2
回答
访问
空
数组或
空
数组时引发错误
java
、
json
、
scala
、
apache-spark
doe", "home": ["1111", "222"], }家庭电话号码数组有时可能是
空
的我的
spark
应用程序收到这些JSONS的列表,并执行以下操作:val result =
浏览 2
提问于2017-05-21
得票数 3
回答已采纳
1
回答
如何在星火中实现不同的分区?
scala
、
apache-spark
、
partitioning
有一个包含列的dataframew:date
和
error。数据的分区应该类似于yyyy-dd-mm,但是所有有错误的列都应该写入不同的位置。是的,我可以添加
过滤
器
和
写两次,但这会导致两次阅读。使用分区“黑客”(理论上)允许读一次
和
写一次。
浏览 1
提问于2022-03-16
得票数 0
3
回答
包含
空
值
的ArrayType行筛选器
apache-spark
、
pyspark
、
apache-spark-sql
假设我有一个像这样的
Spark
dataframe
:现在,我希望筛选数组不包含None
值
的行(在我的例子中,只保留第一行)。array_contains(test_df.a, None)) AnalysisException:“由于数据类型不匹配,无法解析
浏览 1
提问于2021-11-12
得票数 1
2
回答
使用SCALA删除
DataFrame
中的
空格
。(我已经将CSV文件加载到RDD中,然后尝试删除其中的
空格
scala
、
apache-spark
、
rdd
我的CSV文件中的数据包含不需要的
空格
和
空
值
。我已经把这个文件加载到
spark
RDD中了,到目前为止没有问题。现在我必须从这个RDD中删除
空格
和
空
值
。怎么做呢?有没有人能帮我?object Oracle {def main(args: Array[String]): Unit = {import org.apache.
spark</
浏览 41
提问于2019-05-27
得票数 0
2
回答
筛选日期列上的
DataFrame
比较
scala
、
apache-spark
、
apache-spark-sql
我正在尝试使用Scala
和
Spark
筛选一个比较两个日期列的
DataFrame
。根据
过滤
后的
DataFrame
,在顶部运行计算以计算新列。,用于
过滤
DataFrame
。从这个问题开始,,我意识到我需要传递一个字符串
值
。如果我尝试使用像lt(lit("2018-12-15"))这样的硬编码
值
,那么
过滤
就有效了。DataTypes.StringType)) .withColumn(&quo
浏览 0
提问于2019-01-15
得票数 1
回答已采纳
1
回答
当空
值
不是预期
值
时,
Spark
filter函数会
过滤
它
scala
、
apache-spark
、
apache-spark-sql
spark
filter函数在不应该
过滤
空
值
的时候
过滤
空
值
。我的条件$"test" =!= "T"不应该删除空行。val seq = Seq((null, "T"),(null, "F"),(null, "F"),("F", "F"),("T", "C")) import
spark
浏览 31
提问于2021-04-23
得票数 0
回答已采纳
1
回答
在
Spark
DataFrame
中按数组
值
过滤
scala
、
apache-spark
、
dataframe
、
elasticsearch
、
apache-spark-sql
我正在使用带有elasticsearch的apache
spark
1.5数据帧,我试图从包含id列表(数组)的列中
过滤
id。中,我尝试这样做:val
dataFrame
= sqlContext.read .load("index/type")
dataFrame
.filter(
dataFrame
浏览 0
提问于2016-02-25
得票数 2
回答已采纳
2
回答
如何删除星火表列中的空白
python
、
apache-spark
、
pyspark
、
databricks
、
sparktable
我想从特定列(Purch_location)中的所有
值
中删除
空格
。我使用的是
spark
表,而不是
dataframe
或SQL表(但如果需要,我可以使用
dataframe
或SQL表)。下面是我的星火表的生成方式:cols = dataset.columns+----------+----import regexp_replace dataset1=dataset.select
浏览 6
提问于2017-12-03
得票数 2
2
回答
Apache管道:在dataset中
过滤
空行
scala
、
apache-spark
、
apache-spark-sql
、
apache-spark-mllib
、
apache-spark-ml
在我的
Spark
管道(
Spark
2.3.0)中,我使用这样的RegexTokenizer: .setInputCol("text") .setMinTokenLength(3)text| wordsa the | [the
浏览 1
提问于2018-11-19
得票数 0
回答已采纳
1
回答
PySpark DataFrames -使用不同类型列之间的比较进行
过滤
python
、
apache-spark
、
pyspark
、
apache-spark-sql
假设您有一个具有各种类型列(string,double.)的
dataframe
以及在字符串类型列中表示“缺失
值
”的特殊
值
“想念”。from pyspark.sql import SparkSession [1, 'miss'], [None, 'y
浏览 0
提问于2019-01-31
得票数 2
回答已采纳
1
回答
如何在pyspark
dataframe
中任何列为
空
的行中进行筛选
dataframe
、
filter
、
pyspark
、
null
它必须已经在堆栈溢出的某个位置,但是我只是找到了
过滤
吡火花数据ways的行的方法,其中1特定列为null,而不是任何列为null。(range(100)),"column2":["a","b","c",None]*25,"column3":["a","b","c","d",None]*20} sparkDf
浏览 4
提问于2020-08-24
得票数 3
回答已采纳
5
回答
Spark
Dataframe
验证拼接写入的列名
apache-spark
、
pyspark
、
apache-spark-sql
、
spark-streaming
、
parquet
我正在使用从JSON事件流转换而来的
Dataframe
来处理事件,这些数据帧最终会被写成Parquet格式。但是,一些JSON事件在键中包含
空格
,我希望在将其转换为Parquet之前记录
和
过滤
/删除数据帧中的此类事件,因为;{}()\n\t=在拼图方案(CatalystSchemaConverter)中被视为特殊字符如何在
Dataframe
中对列名执行此类验证,并完全删除此类事件,而不会导致
Spark
Streaming作业出错。1
Spark
的Catalyst
浏览 188
提问于2016-07-05
得票数 17
1
回答
基于可用
值
的多列Scala
Spark
数据帧
过滤
器
scala
、
apache-spark
、
apache-spark-sql
我需要用下面的条件
过滤
一个数据帧。 我有2列4Wheels(斯巴鲁,丰田,通用,
空
/
空
)
和
2Wheels(雅马哈,哈雷,印度,
空
/
空
)。我必须
过滤
4Wheels的
值
(斯巴鲁,丰田),如果4Wheels包含
空
/
空
,那么
过滤
2Wheels的
值
(Yamaha,Harley) 我在不同的例子中找不到这种类型的
过滤
。我是
spark</e
浏览 12
提问于2021-08-19
得票数 0
2
回答
使用PySpark连接两个CSV文件中的数据
pyspark
、
mapreduce
我就是这样做的:df2 =
spark
.read.csv('df2.csv', sep=FROM d1 ON d1.id = d2.id;是否有更有效的方法来读取
和</
浏览 2
提问于2022-06-11
得票数 0
1
回答
Spark
-SQL中需要TRUE
和
FALSE列
apache-spark-sql
我正在尝试为
Spark
SQL
DataFrame
编写一个多值
过滤
器。我有:val field: String // The field of interest我正在试着想出
过滤
器的规格。目前,我有: val filter = values.map(value
浏览 5
提问于2017-02-14
得票数 5
回答已采纳
2
回答
火花
过滤
器从来没有应用于
DataFrame
在Java
java
、
oracle
、
apache-spark
、
dataframe
我对
Spark
非常陌生,我有一个查询,它从两个Oracle表中获取数据。这样的表必须由一个字段连接,该字段可以很好地处理下面的代码。但是,我需要应用
过滤
器,就像在Oracle "where“子句中那样。例如,雇用年龄在25岁至50岁之间的员工。我还必须应用GroupBy
过滤
器,并使用OrderBy对最终结果进行排序。其余的
过滤
器根本没有应用,我也不知道为什么。你能帮帮我吗?我确信我遗漏了一些东西,因为没有编译错误。数据加载良好,但"where“条款似乎对数据没有任何影响,尽管有些雇员年龄在25至50岁之
浏览 6
提问于2015-07-08
得票数 2
回答已采纳
点击加载更多
热门
标签
更多标签
云服务器
ICP备案
对象存储
实时音视频
即时通信 IM
活动推荐
运营活动
广告
关闭
领券