腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
文章
问答
(5895)
视频
沙龙
2
回答
懒惰语境下的转型与行动
apache-spark
正如“学习火花:闪电-
快速
大数
据分析
”书中提到的: 正如我所发现的,在对懒惰做了一些解释之后,转换和行动都是懒惰的。
浏览 1
提问于2018-04-10
得票数 2
回答已采纳
1
回答
是否有一篇关于Apache的文章试图像White的Hadoop:权威指南那样全面?
bigdata
、
apache-hadoop
、
apache-spark
Tom White的“Hadoop :权威指南”已经成为整个Hadoop生态系统的流行指南,并赢得了广泛调查和深入报道Hadoop各个方面的声誉。到目前为止,是否有人试图提供类似的火花?
浏览 0
提问于2016-06-04
得票数 1
回答已采纳
1
回答
大数
据分析
参考文献
bigdata
我正在寻找一个好的入门书或课程的
大数
据分析
。在实际应用方面,我对在R中使用
大数
据工具特别感兴趣。谢谢!
浏览 0
提问于2016-11-21
得票数 1
回答已采纳
1
回答
将sql-
Spark
-connector库安装到Azure Synapse Apache
Spark
apache-spark
、
azure-synapse
我正在尝试安装Apache
Spark
Connector for SQL Server和Azure SQL,以便在
大数
据分析
中使用事务数据,并将结果持久化以进行即席查询或报告。连接器允许您使用任何SQL数据库,本地或云中,作为
Spark
作业的输入数据源或输出数据宿。
spark
sql连接器位于此处 有人能告诉我如何在Azure Synapse Apache
Spark
中导入它吗?
浏览 4
提问于2021-10-14
得票数 0
4
回答
Google Dataflow对Apache
Spark
apache-spark
、
google-cloud-dataflow
、
distributed-computing
、
google-cloud-ml
我正在调查、Google、Dataflow、和Apache ,以决定哪种解决方案更适合我们的
大数
据分析
业务需求。我发现在
spark
平台中有
Spark
SQL和MLlib来进行结构化数据查询和机器学习。 我想知道谷歌数据流平台中是否有相应的解决方案?
浏览 2
提问于2015-11-04
得票数 32
回答已采纳
1
回答
对CloudSql执行十亿行插入的吞吐量提高
google-cloud-sql
、
google-cloud-dataproc
我有一个表,每天大约有6亿到10亿行。即30m- 40m recs/小时数据从项目1插入到项目2,从GCS读取拼图文件,使用DataProc集群将其转换为CloudSql可接受的格式,然后插入到CloudSql中,这是考虑到mysql (又称CloudSql)对大容量插入的自然限制。我使用的是一个20主节点的集群。我的目标MySql实例是一个52 GB、8 vCPU的CloudSql实例,具有600 GB固态硬盘存储,并将innodb_write_io_
浏览 1
提问于2021-03-17
得票数 1
1
回答
Dataproc :通过REST API提交
Spark
作业
google-cloud-platform
、
google-cloud-dataproc
我们正在使用GoogleCloudPlatform进行
大数
据分析
。对于处理,我们目前使用的是google cloud dataproc &
spark
-streaming。我想使用REST API提交一个
Spark
作业,但是当我使用api-key调用URI时,我得到了以下错误!
浏览 2
提问于2016-06-13
得票数 0
1
回答
星火堆中的火花调度器与独立调度器
apache-spark
、
architecture
火花核心中的调度程序和下面的Stack中的独立调度程序之间有什么区别(来自学习火花:闪电-
快速
大数
据分析
书)?
浏览 0
提问于2018-04-10
得票数 4
回答已采纳
1
回答
度量收集和分析体系结构
database
、
amazon-web-services
、
architecture
、
bigdata
、
iot
我们正在研制支持家庭套件的IoT设备.HomeKit是为消费者设计的,不具备收集度量标准(功率、温度等)的能力,因此我们需要单独实现它。首先,不需要存储所有数据,因为用户只需要指定时间段的图表,因此需要一些聚合。什么样的数据库解决方案适合它?我相信没有RDMS会处理这么多的数据。那么,如何获取度量的平均数据来将其呈现给最终用户呢? AWS具有共享的时间序列
浏览 0
提问于2018-11-26
得票数 1
1
回答
在码头集装箱上使用Hadoop和星火
hadoop
、
apache-spark
、
docker
、
hadoop-yarn
、
bigdata
我想在我的工作中使用
大数
据分析
。我已经实现了在容器中创建容器的所有码头的东西。然而,我对
大数
据还很陌生,并且我逐渐认识到,在速度重要的时候,使用Hadoop来代替MapReduce而不是在Hadoop上使用
Spark
是网站和应用程序的最佳方式(是吗?)
浏览 3
提问于2016-06-15
得票数 3
回答已采纳
1
回答
谷歌云DataProc的性能监控
google-cloud-platform
、
google-cloud-dataproc
我们正在使用GoogleCloudPlatform进行
大数
据分析
。对于处理,我们目前使用的是google cloud dataproc &
spark
-streaming。
浏览 0
提问于2016-06-13
得票数 0
1
回答
使用
Spark
的
大数
据分析
python
、
apache-spark
、
bigdata
如何修复此错误?我在执行最后一个单元格时出错,我在哪里出错了?它和我的程序版本有关系吗?或者类似的东西? count = Data.map(lambda labelPoint: (labelPoint.label,1)).reduceByKey(lambda x,y: x+y) assert type(counts3) =
浏览 14
提问于2021-10-31
得票数 0
2
回答
使用python或hadoop进行数
据分析
?
anaconda
、
data-science
、
data-analysis
哪种技术可以有效地分析数据hadoop或python?速度介于上述两者之间的是哪种技术?
浏览 61
提问于2018-07-30
得票数 -1
回答已采纳
1
回答
当使用Hive作为数据仓库时,对我的情况有什么好处?
apache-spark
、
hive
、
bigdata
目前,我正在尝试采用
大数
据来取代我目前的数
据分析
平台。我目前的平台非常简单,我的系统从不同的上游系统获得了许多结构化的csv提要文件,然后,我们将它们加载为java对象(即在内存中)进行聚合。我正在寻找使用
Spark
来取代我的java对象层的聚合过程。我的问题是,在我的情况下,如果我引入一个Hive层,
浏览 3
提问于2017-04-17
得票数 0
1
回答
有没有一种简单的方法可以将拼图文件直接加载到Cassandra中?
csv
、
import
、
cassandra
、
parquet
不幸的是,我找不到任何方法(除了通过
SPARK
(在Scala中))将这个文件直接加载到CDB中。如果我把镶木地板文件放到CSV中,它对我的笔记本电脑来说太大了。我正在为一个
大数
据分析
案例设置一个Cassandra DB (我有大约25TB的原始数据,我们需要
快速
获得可搜索的数据)。
浏览 9
提问于2019-11-05
得票数 2
回答已采纳
2
回答
DataOps是什么?
terminology
、
data
那么,将敏捷方法应用于
大数
据和数
据分析
的DataOps会是什么样子呢?这与敏捷软件开发和DevOps有何相似之处?
浏览 0
提问于2019-11-13
得票数 3
1
回答
构建用于学习的小型Hadoop集群的建议
hadoop
、
apache-spark
、
cluster-computing
、
distributed-computing
我有一个
大数
据类的测试,我必须对“较小”的数据集进行一些
大数
据分析
。实际上我已经把我的东西弄清楚了。我在我的Ubuntu16.04上以独立模式安装了Hadoop2.8.1和
Spark
2.2.0 (我使用PySpark构建程序)。实际上,我可以自己去做我的事情。
浏览 5
提问于2017-12-22
得票数 1
1
回答
Apache上下文dropDuplicates
java
、
apache-spark
我已经阅读了1.6.2版本的
Spark
和DataFrames教程,它没有详细描述DataFrame操作。我还在读“学习火花。闪电-
快速
大数
据分析
”一书,但是它是为
Spark
1.5编写的,我需要的操作不在这里描述。我很乐意得到任何一个链接到手册的解释。谢谢。package data; import org.apache.
spark
.api.java.JavaRDD; import org.apache
浏览 0
提问于2016-08-01
得票数 0
回答已采纳
3
回答
检查Azure中数据库运行时的版本
azure
、
version
、
azure-databricks
可以检查Azure中Databricks运行时的版本吗?
浏览 1
提问于2018-12-12
得票数 12
回答已采纳
1
回答
使用Redshift vs
Spark
、Oozie Workflow Scheduler和Redshift分析的
大数
据分析
apache-spark
、
analytics
、
bigdata
、
oozie
、
amazon-redshift
我们希望对存储在Amazon中的数据进行
大数
据分析
(目前为to级,但将随着时间的推移而增长)。为了建立一个能够满足我们未来需求的通用系统,我们希望使用Apache进行数
据分析
。我知道可以从HDFS、HBase和S3将数据读入
Spark
,但是是否支持直接从Redshift读取数据?如果没有,我们可以将数据传输到S3中,然后用
Spark
读取数据。,我的问题是,我们是应该直接通过Redshift的查询执行数
据分析
,还是应该使用上面的方法并通过ApacheSpark进行分析(这里的问题是数据局部
浏览 3
提问于2015-02-16
得票数 0
回答已采纳
点击加载更多
相关
资讯
什么是 Apache Spark?大数据分析平台详解
走进大数据 Spark-Spark streaming
大数据:Spark
Spark快速入门-2-Spark的编程模型
大数据-Spark揭秘
热门
标签
更多标签
云服务器
ICP备案
对象存储
云点播
实时音视频
活动推荐
运营活动
广告
关闭
领券