本方案是面向录音卡类硬件的一站式端到端解决方案:基于腾讯云蓝牙端到端传输 SDK 与 VoiceAI SDK,覆盖「录音设备采集 → 蓝牙链路传输 → App 端 AI 降噪与识别 → ASR 识别 → 结构化文本输出」完整链路。已适配的芯片15分钟即可完成集成跑通,输出带发言人和时间轴的结构化文本。

方案优势速览
十五分钟集成(已适配芯片):针对已完成适配的芯片平台,蓝牙端到端传输 SDK 与 VoiceAI SDK 均提供完整 Demo 与简洁接口,设备端接入蓝牙传输、App 端接入识别链路,15分钟即可完成端到端跑通验证。
一整套端到端蓝牙传输方案:覆盖「录音设备采集 → 蓝牙链路传输 → App 端识别输出」全链路,设备端与端侧 SDK 组合开箱即用,无需自行打通传输与识别两段链路。
AI 降噪能力:VoiceAI SDK 内置端侧 AI 降噪,在识别前抑制环境噪声,保障嘈杂场景下的转写质量。
端到端蓝牙传输方案
录音卡类产品的核心难点在于设备端音频如何稳定、低延迟地到达手机端识别引擎。本方案由腾讯云提供覆盖全链路的 SDK 组合,客户无需自行研发或拼接传输链路:
设备端:蓝牙端到端传输 SDK 在录音设备侧完成音频采集与传输,音频经蓝牙链路实时送达手机。
手机端:App 通过外部 PCM 喂入模式接收设备音频,直接送入 VoiceAI SDK 处理,不依赖手机麦克风采集。
全链路对齐:传输与识别接口已由两个 SDK 组合打通,客户按 Demo 对接即可,无需自行处理链路衔接。
AI 降噪能力
项目集成的
VoiceAI SDK 包含客户端 AI 降噪处理能力。其目标不是生成更“悦耳”的声音,而是在音频送入识别引擎前抑制环境噪声、提高语音可懂度,从而减少噪声触发、漏识别和误识别。能力维度 | 说明 |
端侧前处理 | 降噪位于音频输入与 ASR 之间,可在上云前改善信噪比,减少无效噪声对 VAD 和识别模型的干扰。 |
AI 模型降噪 | SDK 内置多条 AINS 处理路径,包含面向 ASR 和会议场景的处理策略,可按实际声学环境选择。 |
复杂噪声适配 | 适用于空调、风扇、键盘、设备运行声等稳态或非稳态背景噪声;实际效果取决于拾音距离、信噪比和设备算力。 |
识别能力
识别链路基于成熟的 ASR 与说话人分离能力,同时支持录音过程中的流式识别和录音完成后的全量识别:
实时流式识别:按语音片段返回可修订的中间结果和最终结果,支持语音活动检测(VAD),满足边录边看的低时延场景。
录音文件识别:生成高完整度转写结果,返回语句文本、起止毫秒时间和说话人编号,适合会后归档与检索。
说话人分离:实时与录音文件链路均开启,输出「谁在什么时候说了什么」的结构化语句分段。
应用场景
应用场景 | 核心诉求 | 方案能力 |
多人会议 | 边录边看转写,并在会后快速定位不同发言者的观点。 | 实时 ASR + 实时说话人分离 + 带时间轴的录音文件识别。 |
采访与调研 | 完整保留长时间对话,减少人工听写和区分采访对象的成本。 | 长录音分片转写 + 语句级时间戳 + 说话人编号。 |
嘈杂办公环境 | 降低空调、风扇、键盘等背景噪声对识别效果的影响。 | 端侧 AI 降噪 + VAD + ASR 友好型音频处理。 |
功能优势
优势 | 说明 |
十五分钟集成 | 针对已适配芯片,设备端蓝牙传输 SDK 与 App 端 VoiceAI SDK 均提供完整 Demo 与封装接口,15分钟即可完成端到端跑通。 |
端到端蓝牙传输方案 | 覆盖设备采集、蓝牙传输、端侧识别输出的完整链路,设备端与端侧能力组合交付,开箱即用。 |
实时与离线识别互补 | 实时 ASR 提供低时延反馈,录音文件识别提供完整文本和精确时间轴,分别服务录中和录后场景。 |
文本与角色同时结构化 | 识别结果不仅包含文字,还包含发言人编号、片段状态和时间信息,便于直接进入纪要、检索和大模型分析链路。 |
AI 降噪能力 | VoiceAI SDK 内置 AI 降噪能力,可在识别前抑制环境噪声、改善音频质量,降低真实办公和移动环境中的噪声干扰。 |