首页
学习
活动
专区
圈层
工具
发布

#spark

Apache Spark是一个开源集群运算框架,Spark使用了存储器内运算技术,能在数据尚未写入硬盘时即在存储器内分析运算。

Iceberg 把删除重做了三遍,v3 这一遍才算做完

用户12788355

九月底,Apache Iceberg 的 dev 邮件列表上挂出一个投票,标题是 [VOTE][SPEC] Forbid writing new equalit...

700

Spark 选 join 策略靠的是估算值,估错了它只会悄悄降级。

用户12788355

一条 join 落在集群上,可能走四种完全不同的算法,代价差出一个量级甚至更多。选哪一种的不是你,是 Spark 自己,依据是它手里那份统计信息。统计信息大概率...

7810

Muse 的工作原理是什么?拆解云端虚拟机与 Muse Spark 模型

克劳德2048

每次有人问我 Muse 为什么能替人办事,我都会先纠正一个误区:它靠的不是一个大模型,而是一整套「模型 + 云端虚拟机 + 安全哨兵」的系统。用一句话概括工作原...

16010

DataX 与 Spark 怎么选?qData 开源数据中台双执行引擎技术选型解析

吴同

随着数据平台需要接入的数据源类型和数据处理任务也在持续增多。在实际的数据集成场景中,不同任务对执行引擎的要求并不相同。

20410

Apache DolphinScheduler 任务节点实战合集:从 SQL、DataX 到 Spark、Flink 一次配置全打通

Apache DolphinScheduler

本文是一篇关于Apache DolphinScheduler 在实际项目中的应用实战笔记,包含 DolphinScheduler 执行 SQL 或存储过程、调用...

33510

腾讯云智能数据湖计算AI DLC发布会回顾:Spark+Ray一体化,面向Agent重构数据底座

腾讯云大数据

导读:当 AI Agent 从“能对话”进入“能执行任务”的生产阶段,企业数据平台面对的已不只是新增一种应用形态,而是数据形态、计算资源、训练范式和开发方式的同...

54613

大数据批处理容器化:Spark on Kubernetes 成本优化实践

克劳德2048

摘要: 将 Spark 批处理任务迁移到 Kubernetes 容器平台,可显著提升资源利用率并降低总体拥有成本。本文介绍基于 TKE 的 Spark 容器化方...

17410

腾讯云发布智能数据湖计算AI DLC 支持Spark和Ray同一平台运行

腾讯云大数据

7月25日,腾讯云正式发布智能数据湖计算平台AI DLC,面向自动驾驶、具身智能、Agent等AI场景,提供覆盖数据处理、训练、推理到 Agent 应用的一体化...

41710

DGX Spark 极限压榨!深度优化 DeepSeek-V4:35token/s、单机承载 766K 上下文多智能体服务

GPUS Lady

英伟达开发者论坛用户 entrpi 于 7 月 15 日公开一套深度适配DGX Spark(GB10 Blackwell)的 DeepSeek-V4-Flash...

1.9K10

实战指南 | Kubernetes环境下DolphinScheduler与Spark集成

Apache DolphinScheduler

随着企业数据规模的快速增长,传统物理机或虚拟机部署Apache DolphinScheduler面临着环境配置复杂、资源利用率低、扩展性差等痛点。特别是在需要运...

23710

本地自主 AI 智能体代码迁移 :基于 NVIDIADGX Spark端到端落地实践

GPUS Lady

本文整理自 NVIDIA 线上直播讲座《DGX Spark Live: Autonomous AI Agent Migration》。本场直播携手高能效 AI ...

33410

让Spark和Ray跑在同一平台:腾讯云AI DLC即将发布

腾讯云大数据

Spark 集群跑 ETL,清洗完写到 OSS → AI 团队从 OSS 拉数据到 GPU 集群 → 做特征工程 → 训练 → 模型推回 OSS → 推理服务再...

30100

Meta Muse Spark 1.1 逼近 Opus 4.8

AI约翰

Meta 关上开源的大门 ,把全部赌注压进 Muse Spark——1款比 Claude 更便宜的 闭源模型 。

25210

Meta 重回牌桌!首个推理模型 Muse Spark 震撼发布,全面转向闭源!

AI约翰

曾几何时,Meta 是开源 AI 的坚定拥护者,Llama 系列模型一度成为全球开发者手中的利器。然而,就在今天,扎克伯格用一个重磅炸弹,彻底颠覆了所有人的认知...

43710

用 NCCL 检查 2 台 DGX Spark 协同合作

GPUS Lady

前面《 小白教程:两台 NVIDIA GB10 系统如何互联》已经带着大家用 QSFP 网线连接两台 DGX Spark 设备,本文就进一步用 NVIDIA 的...

50510

国内首个生产级Spark+Ray智能数据湖平台来了!

腾讯云大数据

传统"数据平台 + AI 平台"的两套架构,让数据在搬运中流失价值、让运维成本随规模指数增长。Agent 需要的不是更多的管道,而是一块能让数据与 AI 计算原...

42010

用QSFP连接两台DGX Spark协同工作

用户4730701

这里同样有两种方式,熟悉 SSH 的人可以自己手动处理,不熟悉的可以使用 discover-sparks 工具来处理,都很简单

82700

数据倾斜导致 Spark 作业慢?从原理到优化的完整攻略

gavin1024

摘要: Spark 作业执行缓慢,数据倾斜是常见原因。本文介绍数据倾斜的产生原理、识别方法,以及提高并行度、两阶段聚合、广播连接、 AQE 自适应执行和 RSS...

40610
领券