认证概述
腾讯云面向大数据从业者推出的专业认证,重点考查考生对大数据核心概念、Hadoop 生态、分布式存储、批处理与流计算、检索与查询分析、数据湖与数据仓等领域的整体掌握程度,以及在常见业务场景下进行选型与方案设计的能力。
建议报名该认证的考生具备以下知识或经验:
了解 Linux 基本操作与 Shell 命令。
掌握至少一种数据库使用与基本 SQL。
对分布式系统、并行计算的基本概念有一定了解。
了解 Java / Scala / Python 中至少一种语言。
基本信息
考试类型:理论考试。
考试形式:线下。
题型与题量:单选题40道、多选题20道。
通过/满分分数:70/100分。
考试时长:90分钟。
考试语言:简体中文。
其他注意事项:
1. 多选题错选、漏选不得分。
2. 考试报名和考试预约指引:个人报名和考试指引。
3. 成绩查询:考试结束后可通过腾讯云培训认证的 个人中心-认证考试 页面查看成绩,理论考试成绩3天内公布。
建议的学习资源
资源类别 | 资源地址 |
在线课程 | |
社区生态 | Apache Hadoop / Spark / Flink / Iceberg / Kafka 等开源社区官方文档 |
知识点占比与考核重点
知识点 | 比例 | 考核重点 |
大数据基础速成 | 7% | 5V 框架(Volume / Velocity / Variety / Veracity / Value)的准确含义与各自对应的技术挑战,并能判断「小数据」与「大数据」的临界点信号。 批处理、流处理、湖仓一体三种计算范式在延迟、吞吐、成本上的本质差异,以及由场景到范式的映射方法。 Lambda(批流双链路)、Kappa(流处理统一)、Medallion(Bronze / Silver / Gold 分层)三种架构的演进逻辑、优缺点与适用场景。 开源自建与云托管在人力投入、运维复杂度、升级成本与弹性能力上的成本结构差异。 |
腾讯云大数据产品全景图 | 6% | 九大产品族按存储 / 接入 / 计算 / 数仓 / 搜索 / 治理 / 可视化的分层关系,以及以产品组合而非单产品解决问题的售前思维。 「不讲概念讲业务」的五分钟话术:从客户业务痛点切入,自然过渡到产品族,并覆盖金融、互联网、政务等行业模板。 高频客户痛点 Top 20(数据增长过快、报表延迟高、实时风控慢、多源难整合、治理不规范等)到产品族的快速映射。 与 AWS、阿里云、Snowflake、Databricks 在功能、价格、生态、技术支持四个维度的对标要点与腾讯云差异化优势。 |
存储与数据接入基础 | 10% | COS 标准 / 低频 / 归档三层存储在成本与访问延迟上的差异,生命周期策略驱动的自动冷热迁移,以及 raw / stage / curated 数据湖目录布局。 CKafka 的主题、分区、消费者组与 Exactly-Once 语义,以及其在峰值削峰与系统解耦两方面的核心价值。 DataInLong 的三大典型场景(入湖入仓分析、数据中台底座、大数据迁移上云)与五大优势(流批一体、读写分离、星型模型、传输可靠、轻量可视),支持 30+ 数据源。 接入选型决策树:按数据源类型与实时性要求,在 CDC 同步、日志采集、批量迁移、流式管道之间快速选对工具。 |
EMR 托管 Hadoop 生态 | 13% | 经典、计算存储分离、容器化三种集群形态的差异,以及由弹性与存储解耦需求驱动的选型依据。 HDFS、YARN、Hive、Spark、HBase 五大组件的功能定位与最佳战场,以及云上版本在弹性、自动调优、高可用方面的增强。 Iceberg 湖仓表格式的核心能力:ACID 事务、模式演进、时间旅行、分区演进,及其与 Hive 表 / Delta Lake / Hudi 的差异。 节点机型(计算型 / 内存型 / 大数据型)、付费模式(按量、包年包月、抢占式)与跨可用区高可用的综合成本与运维权衡。 结合真实案例评估以 EMR 替换自建 CDH 的成本与运维收益(含成本降幅与运维投入降幅等量化指标)。 |
数据湖计算 DLC | 10% | DLC 无服务器、按 SQL 计费、零集群运维的服务形态,以及 Spark SQL / Presto / Hive 多引擎统一接口。 DPU 计费模型(1 DPU = 4 vCPU + 16 GB 内存)的含义,典型 SQL 的消耗估算,以及与 EMR 按节点小时计费的本质差异。 适用场景判断:Ad-Hoc 探索、偶发 BI 查询、低频批跑任务;以及按负载频率、SQL 复杂度、成本敏感度、运维偏好选择 DLC 还是 EMR。 直读 COS 上的 Parquet / ORC / Iceberg 数据,以及「DLC + EMR 混部」的组合实践。 |
Oceanus 托管 Flink 流计算 | 12% | Oceanus 作为托管 Apache Flink 的核心能力,以及相对开源自建的托管价值(一键创建集群、自动扩缩、专家调优、Connector 扩展、企业级监控告警)。 Flink 五大核心概念:事件时间窗口、水位线、状态管理(Keyed / Operator State)、Checkpoint 容错、Exactly-Once 端到端语义。 Flink SQL 的常用写法(CREATE TABLE 定义源与目标、INSERT INTO SELECT 描述变换、窗口函数处理时间维度)与 30+ 内置 Connector 的选择。 典型实时链路设计:CKafka 接入 → Oceanus 计算(含 Redis 等维表关联)→ 实时拦截 → TCHouse-D 报表,并能说明各环节的延迟与一致性取舍。 |
云数据仓库 TCHouse 家族 | 13% | TCHouse-D / C / P 分别基于 Doris / ClickHouse / Greenplum 内核的定位差异,以及「同一家族、不同内核」的产品设计哲学。 TCHouse-D 的 MPP 架构、向量化执行、物化视图、预聚合与按主键 UPSERT 能力,适用于高并发点查与秒级实时报表。 TCHouse-C 的高压缩比与 GB/s 级扫描能力在 PB 级日志分析中的用法,以及与 Elasticsearch Service 在日志场景的分工(ES 强检索、TCHouse-C 强聚合)。 TCHouse-P 的完整 PostgreSQL 兼容性与复杂窗口函数、递归 CTE、自定义聚合在风控建模等场景的优势。 依据查询模式、数据规模、并发要求、生态兼容性、成本五要素的 D / C / P 三选一决策矩阵。 |
Elasticsearch Service 日志与搜索分析 | 7% | ES Service 在托管 Elasticsearch 之上的自研增强(自治索引、Bulk Routing、ZSTD 压缩、熔断限流)与三大场景:日志分析、信息检索、RAG AI 应用。 日志场景标准技术栈 CLS 采集 → ES 存储查询 → Kibana 可视化,含冷热分层架构、ILM 索引生命周期管理与跨可用区容灾设计。 全文检索与向量混合检索(倒排索引、评分函数、同义词扩展、Dense Vector、KNN、混合搜索)在电商搜索与内容推荐中的应用。 自建 ES 与腾讯云 ES Service 在成本、性能、运维、高可用、安全五个维度的对比结论。 |
WeData 一站式开发治理平台 | 15% | WeData 六大模块(数据集成、数据开发、任务调度、监控告警、数据治理、AI Agent)的功能边界与协作关系。 数据集成与 ETL 开发:可视化 ETL 编辑器、30+ Connector、统一 IDE 支持 SQL / PySpark / Flink SQL,以及「业务库 → CDC → 湖 → 仓 → BI」标准管道。 数据中台基础设施设计:DAG 调度依赖与重试、任务监控与 SLA 告警、数据质量规则引擎、表级与字段级双层血缘及影响分析。 合规治理能力:数据资产目录、分级分类(公开 / 内部 / 机密 / 高敏)、ABAC 字段级权限管控、全链路操作审计,满足金融数据治理与等保 2.0 三级要求。 WeData Agent 的用法:以自然语言生成 ETL、查询血缘、解释任务报错并给出修复建议、评估数据质量与定位性能瓶颈。 |
BI · 选型决策树 · 客户案例 · 课程综合 | 7% | 腾讯云 BI 的三种产品形态(自助式分析、固定报表、移动看板)及其与 TCHouse / DLC 的集成与嵌入式用法。 端到端全栈选型决策树:场景识别(实时风控 / 日志分析 / BI 报表 / ML 训练 / 数据中台)→ 关键约束(延迟 / 规模 / 并发 / 成本)→ 推荐产品组合。 典型客户案例的拆解方法:业务背景、痛点、技术方案(产品组合与架构)、量化结果与可复用经验。 课程综合串联:九大产品族能力地图、五大典型架构(Lambda / Kappa / Medallion / 实时风控 / 数据中台)、痛点 Top 20 与全栈选型框架。 |