首页 - 港股 - 公司报道 - 正文

通义百聆迎来重磅升级 Fun-CosyVoice3(0.5B)正式开源 可实现极速克隆音色

来源:智通财经 2025-12-15 16:31:57
关注证券之星官方微博:

(原标题:通义百聆迎来重磅升级 Fun-CosyVoice3(0.5B)正式开源 可实现极速克隆音色)

智通财经APP获悉,12月15日,“通义大模型”微信公众号发文表示,通义百聆语音模型再升级,本次发布包括:Fun-CosyVoice3模型升级,首包延迟降低50%,中英混字准确率翻倍,支持9语种 18方言口音、跨语种克隆与情感控制;Fun-CosyVoice3(0.5B)正式开源,该版本提供了zero-shot音色克隆能力,只需要提供一段3秒以上的参考音频,即可复刻其音色并合成新语音,并且支持本地部署和二次开发。此外,通义推出轻量化版本Fun-ASR-Nano模型,总参数量压缩到0.8B,推理成本更低,现已开源,支持本地部署与定制化微调。

通义团队称,本次Fun-CosyVoice3大模型完成多项关键升级:

首包延迟降低50%,支持双向流式合成,真正实现“输入即发声”,适用于语音助手、直播配音、无障碍阅读等实时场景;

中英混说词错误率(WER)相比之前降低 56.4%,不论是含专业术语、大小写混排,还是语码转换的句子,都能精准、自然地发音;

在 zero-shot TTS评测中,内容一致性与音色相似度全面提升,复杂场景(test-hard)字符错误率(CER)相对降低 26%,接近人类录音水平;

9种通用语言、18种中文方言、9种情感控制,并具备跨语种音色复刻能力——用一段普通话录音,即可生成粤语、日语、英语等语音,音色保持高度一致。

Fun-ASR模型能力同样得到了增强。作为通义百聆推出的端到端语音识别大模型,Fun-ASR 基于数千万小时真实语音数据训练,已在钉钉“AI听记”、视频会议等场景中大规模落地。本次,通义对 Fun-ASR 的核心能力进行了全面升级,重点优化了嘈杂环境鲁棒性、多语言自由混说、中文方言与口音覆盖、歌词识别、定制化能力,并将流式识别模型的首字降低到160ms。

微信
扫描二维码
关注
证券之星微信
APP下载
广告
下载证券之星
郑重声明:以上内容与证券之星立场无关。证券之星发布此内容的目的在于传播更多信息,证券之星对其观点、判断保持中立,不保证该内容(包括但不限于文字、数据及图表)全部或者部分内容的准确性、真实性、完整性、有效性、及时性、原创性等。相关内容不对各位读者构成任何投资建议,据此操作,风险自担。股市有风险,投资需谨慎。如对该内容存在异议,或发现违法及不良信息,请发送邮件至jubao@stockstar.com,我们将安排核实处理。如该文标记为算法生成,算法公示请见 网信算备310104345710301240019号。
网站导航 | 公司简介 | 法律声明 | 诚聘英才 | 征稿启事 | 联系我们 | 广告服务 | 举报专区
欢迎访问证券之星!请点此与我们联系 版权所有: Copyright © 1996-