本文作者:Han Su, Tianyu Huang, Zichen Wan, XiaoHe Wu, Wangmeng Zuo 作者单位:哈尔滨工业大学 论文标题:S²AM3D:Scale-controllable Part Segmentation of 3D Point Clouds Oral 论文 论文链接:https://arxiv.org/pdf/2512.00995 项目主页:https://sumuru789.github.io/S2AM3D-website/

图1:三种分割范式对比与方法性能
3D零件级分割(Part Segmentation)是3D视觉理解中的核心任务之一,旨在将3D物体的点云分割为语义上有意义的组成部分,如椅子的"腿"、"靠背"、"坐垫"等。该任务在机器人抓取、3D编辑、逆向工程等下游应用中具有重要意义。
近年来,受2D基础模型(如SAM)的启发,研究者们提出了多种3D零件分割方案,但现有方法普遍存在以下挑战:
🔹 纯3D方法(Native 3D):如SGPN等,虽然能学习原生3D特征,但受限于3D标注数据的稀缺,难以泛化到开放世界的多样化物体。
🔹 基于2D的方法(2D-Based):如PartField等,通过将2D基础模型的知识迁移到3D,获得了良好的泛化能力。然而,由于仅在2D多视图上进行推理,这些方法面临严重的跨视角不一致性(cross-view inconsistency)问题——同一个3D点在不同视角下可能被分配到不同的零件,导致分割结果不稳定。
🔹 分割粒度不可控:现有方法几乎都无法让用户灵活控制分割的粒度。例如,对于一辆汽车,用户可能希望得到"车轮"这一整体部件,也可能需要更精细地分出"轮胎"和"轮毂"。
本文提出了 S²AM3D,一种全新的 2D-3D混合训练范式,融合了2D预训练模型的强大泛化能力与原生3D对比学习的跨视角一致性,并首次引入 尺度可控的提示解码器(Scale-Aware Prompt Decoder),让用户可以通过一个连续的scale参数来控制分割粒度,在同一模型中实现从粗到细的灵活分割。
本文的核心贡献可以总结为以下三点:
🏗️ 点一致性零件编码器(Point-Consistent Part Encoder)
提出2D-3D混合训练方案:在编码器阶段,使用来自2D SAM的多视角伪标签作为监督信号来训练3D特征提取器,同时利用原生3D空间中的对比学习来显式约束特征的跨视角一致性,从根本上解决了纯2D方法的不一致性问题。
🎛️ 尺度感知提示解码器(Scale-Aware Prompt Decoder)
设计了一个scale-aware的解码器,在标准的点提示之外,额外接收一个连续的尺度参数 。通过 FiLM调制(Feature-wise Linear Modulation) 和 双向交叉注意力(Bi-directional Cross-Attention) 机制,模型能够根据尺度参数动态调节解码过程中的特征表示,从而输出不同粒度的零件掩码。
📊 大规模数据集 PartObjaverse-100K
构建了一个包含 10万+ 高质量3D零件级标注的大规模数据集,覆盖了丰富多样的物体类别。通过PointNet质量过滤和连通性细化等流程,保证了标注质量。
S²AM3D由两大核心模块组成:点一致性零件编码器 和 尺度感知提示解码器。

图2:S²AM3D整体架构。左侧为点一致性零件编码器,通过2D-3D混合训练提取跨视角一致的3D特征;右侧为尺度感知提示解码器,利用FiLM调制实现粒度可控的零件分割。
编码器的核心思想是:既要学习2D预训练模型的泛化能力,又要保证3D特征的跨视角一致性。
具体来说,编码器的训练分为两部分:
编码器架构采用了 Point Voxel CNN + Triplane CNN & Transformer 的两阶段设计,先提取局部几何特征,再通过三平面表征捕捉全局上下文。
这是本文最具创新性的设计之一。解码器的输入为:
尺度调制器(Scale Modulator) 将尺度参数 通过正弦嵌入和参数映射网络转换为 FiLM 调制参数 ,然后对 Transformer Block 的中间特征进行 feature-wise 的仿射变换:
随后,通过双向交叉注意力将提示点的特征与全局点云特征进行交互,在尺度调制后的特征空间中解码出对应粒度的零件掩码。
这种设计使得模型可以在同一个前向传播中根据scale参数的不同值输出从精细到粗糙的不同层级的分割结果,无需为每个粒度训练单独的模型。
为了提供充足的训练数据,作者基于Objaverse构建了PartObjaverse-100K数据集:

图3:PartObjaverse-100K数据集概览。左侧展示了丰富多样的3D零件级标注;右侧展示了质量过滤和连通性细化流程。
该数据集包含超过10万个3D模型的零件级标注,覆盖了从玩具、家具到武器、工具等丰富的物体类别。数据集构建流程包括:
在交互式分割任务中,S²AM3D在PartObjaverse-Tiny和PartNet-E两个benchmark上均取得了显著优势:

图4:交互式分割可视化对比。从上到下分别为:GT、Ours(+scale)、Ours、P³-SAM、Point-SAM。S²AM3D的分割结果与真值最为接近,边界更加精确。
在全自动分割任务中,S²AM3D同样取得了优异的结果:
S²AM3D的一大亮点是连续尺度控制能力。如下图所示,使用相同的提示点,随着scale参数从0逐渐增大到1,分割结果从精细的局部零件平滑过渡到粗粒度的整体部件:

图7:连续尺度可控性可视化。同一个提示点,不同scale值下的分割结果。从左到右:无scale控制、scale从0到1递增。分割粒度从精细到粗糙平滑过渡。
消融实验验证了各个组件的重要性:

图6:消融研究可视化。3D细化模块能显著提升特征质量和分割边界。
S²AM3D通过 2D-3D混合训练范式 和 尺度感知提示解码器,在3D零件级分割任务上取得了全面的优异性能:
✅ 解决跨视角不一致性:3D对比学习显式约束特征一致性
✅ 首次实现连续尺度控制:一个模型支持从粗到细的灵活分割
✅ 构建大规模数据集:PartObjaverse-100K提供了10万+高质量标注
✅ 取得全面领先的性能:在交互式和全自动分割任务上均取得最优结果