方案概述
即时通信 IM AI 智能语音服务,基于腾讯领先的 AI 语音识别引擎,将语音转文字(ASR)、文本转语音(TTS)及翻译的全链路处理能力嵌入 IM SDK,支持多种场景灵活使用。帮助开发者在自己的应用内快速构建微信、元宝同款的“AI 语音输入”交互体验。其核心优势体现在以下三个维度:
通过 ASR 语音识别引擎,可高效将语音转化为文本,广泛应用于聊天语音输入、语音消息识别等场景。
在语音转文字的基础上,翻译能力可实现跨语言内容的转写与沟通,让用户用母语说话,对方直接看到翻译后的文字。
TTS 文字转语音技术,可将文本转化为自然流畅的语音输出,轻松构建语音播报、AI 变声、个性化语音消息等多样化应用。
AI 能力合规使用提示:
本服务基于大语言模型/语音大模型技术,生成结果可能因场景复杂性、数据质量、环境因素等原因而存在偏差,腾讯云不对生成内容的准确性、完整性、合法性、不侵权性提供担保。
您在使用本服务时应遵守《互联网信息服务深度合成管理规定》、《生成式人工智能服务管理暂行办法》《个人信息保护法》等相关法律法规,确保使用本服务处理的数据已获得相关主体的合法授权,不得使用本服务生成虚假信息、诈骗内容、色情低俗内容、损害他人合法权益的内容及其他违反法律法规要求的内容,不得用于伪造他人声音或从事任何违法活动。
功能优势
AI 语音识别精准高效
依托腾讯在 AI 能力上的深厚积累,引入大模型语音识别引擎,在含噪声、口音混杂等复杂音频环境下,识别准确率显著提升。支持中文普通话、英语、粤语、多地方言及多种小语种的精准识别,覆盖主流语言沟通需求。
毫秒级实时转写
语音输入的实时识别延迟可控制在毫秒级,实现“边说边出文字”的流畅体验。超高转写速率确保用户在口述过程中,文字内容同步输出,不打断表达节奏。
智能语义理解
AI 语音交互不仅能“听见”,更能“听懂”。系统智能理解上下文语义,自动断句、智能添加标点符号,无需用户二次编辑修改。
应用场景
微信同款的“语音输入”交互体验
从元宝、豆包等 AI 应用带火语音交互,到微信、企微强化“AI 语音输入”能力,语音正在成为移动端输入的主流方式之一。用户只需按住说话,语音即可被实时转写为文字并填入输入框,点击即可发送消息。相比传统的文字输入方式,AI 语音输入具备更高的输入效率、更低的操作成本和更自然的交互体验,是 IM 应用输入交互的全新升级方向。
腾讯云 IM AI 语音交互提供多种主流 UI 交互模式,旨在帮助开发者将这一国民级交互体验快速融入自己的 IM 应用。
交互模式 | 说明 |
长按输入框语音输入 | 长按输入框后进入语音录入状态,松手后自动将识别文字填入输入框。 |
点击语音转文字按钮 | 点击输入框右侧语音转文字图标,进入语音输入模式。 |
按住说话 + 滑动转文字 | 按住说话后,滑动手指至“转文字”按钮区域松手,实现语音转文字发送。 |
以上交互模式延续用户在微信及企微中的使用习惯,降低功能学习成本,提升用户体验。
其他场景推荐
应用场景 | 使用方式与价值 |
跨语言沟通 | 语音输入结合翻译能力,用户用自己的语言说话,应用实时转写后直接翻译成对方熟悉的语言,以原文和译文对照形式呈现在消息气泡中。无需在翻译工具和聊天窗口间反复切换,让跨语言聊天像母语沟通一样自然。 |
企业办公 | 口语化表达经 ASR 后,进一步通过 AI 修饰,自动转为更规范的书面文本。系统在保留原意的基础上,去除重复、停顿、口头禅,改写为更清晰正式、适合发送给同事或客户的文字。 |
AI 机器人对话 | 用户通过语音与 AI 机器人自然交互,语音实时转写为文字发送给机器人;机器人回复的文本通过 TTS 合成为语音播放,实现全链路语音交互体验,让用户像打电话一样与 AI 自由对话。 |
有声内容与语音播报 | 通过 TTS 将文本内容转换为自然语音,适用于消息朗读、通知播报、无障碍阅读等场景。支持多音色切换和声音克隆,满足个性化语音输出需求。 |
能力全览
语音转文本(ASR)
语音消息转文字
特性及支持语种见下表。
说明 | 语种 |
该场景将已发送出去的语音消息转文字 | 可支持中文普通话、中英混、方言和小语种,包括:zh(中文)、en(英语)、yue(粤语)、ar(阿拉伯语)、de(德语)、fr(法语)、es(西班牙语)、pt(葡萄牙语)、id(印尼语)、it(意大利语)、ko(韩语)、ru(俄语)、th(泰语)、vi(越南语)、ja(日语)、tr(土耳其语)、hi(印地语)、ms(马来语)、nl(荷兰语)、sv(瑞典语)、da(丹麦语)、fi(芬兰语)、pl(波兰语)、cs(捷克语)、fil(菲律宾语)、fa(波斯语)、el(希腊语)、ro(罗马尼亚语)、hu(匈牙利语)、mk(马其顿语)。 |
录音转文字
特性及支持语种见下表。上传 60 秒以内的语音,同步返回识别结果
说明 | 语种 |
该场景可支持将还未发出的音频识别为文字 | 可支持中文普通话、中英混、方言和小语种,包括:zh(中文)、en(英语)、yue(粤语)、ar(阿拉伯语)、de(德语)、fr(法语)、es(西班牙语)、pt(葡萄牙语)、id(印尼语)、it(意大利语)、ko(韩语)、ru(俄语)、th(泰语)、vi(越南语)、ja(日语)、tr(土耳其语)、hi(印地语)、ms(马来语)、nl(荷兰语)、sv(瑞典语)、da(丹麦语)、fi(芬兰语)、pl(波兰语)、cs(捷克语)、fil(菲律宾语)、fa(波斯语)、el(希腊语)、ro(罗马尼亚语)、hu(匈牙利语)、mk(马其顿语)。 |
语音合成(TTS)
将文本内容转化为自然流畅的语音输出,可用于语音播报、AI 变声、个性化语音消息生成等场景。
实时语音合成
说明 | 语种 |
将文本内容实时转换为语音音频文件。适用于 AI 机器人的流式输出、AI 对话等即时场景。支持系统预置音色或用户克隆的自定义音色。 | 中文、英语、日语、粤语 |
一句话语音合成
说明 | 语种 |
针对短文本场景的轻量级语音合成,适用于通知播报、消息朗读、语音提醒等场景。快速返回合成结果,满足低延迟需求。 | 中文、英语、日语、粤语 |
声音克隆:基于少量音频样本生成专属音色
基于一段参考音频,克隆出专属自定义音色。克隆成功后返回音色 ID,可在后续 TTS 调用中使用,实现个性化声音定制。
说明:
翻译
基于大语言模型技术的深度语义理解能力,系统能够自主适应目标语言表达习惯,实现自然流畅翻译效果。相较于传统翻译,翻译结果的机械感显著降低,在对话交流、泛娱互动等复杂场景下的效果提升明显。
特性及支持语种见下表。
说明 | 语种 |
文本翻译 | 国内:重点支持 33 个语种互译(中文、英语、法语、葡萄牙语、西班牙语、日语、土耳其语、俄语、阿拉伯语、韩语、泰语、意大利语、德语、越南语、马来语、印尼语、菲律宾语、印地语、繁体中文、波兰语、捷克语、荷兰语、高棉语、缅甸语、波斯语、古吉拉特语、乌尔都语、泰卢固语、马拉地语、希伯来语、孟加拉语、泰米尔语、乌克兰语),支持 5 种少数民族语言/方言(藏语、哈萨克语、蒙古语、维吾尔语、粤语)。 境外:目前已经支持的翻译语言请参见 文本翻译语言。 |
效果展示
文本消息翻译效果 | 翻译效果 |
![]() | ![]() |
接入方式
即时通信 IM AI 语音交互能力支持以下接入方式:
无 UI 接入:支持通过 IM SDK 客户端接入;部分功能同时支持通过服务端 REST API 接入。具体能力及对应接入方式,可参考各功能章节中的链接。
含 UI 接入:支持通过 IM UIKit 客户端接入。

