小程序开放平台

文档中心
模型标准出入参
模型列表
文本模型
多模态(文生图&图片理解)
多模态(文档模态DOC、PDF)
图片编辑&人像风格
(Beta)TTS语音合成
cosyvoice-v1 模型介绍
cosyvoice-v2 模型介绍
cosyvoice-v3-flash 模型介绍
cosyvoice-v3-plus 模型介绍
cosyvoice-v3.5-flash 模型介绍
cosyvoice-v3.5-plus 模型介绍
CosyVoice 音色列表

cosyvoice-v2 模型介绍

模型服务
>
模型列表
>
(Beta)TTS语音合成
>
cosyvoice-v2 模型介绍
>
更新时间:2026-03-20 15:08:44

模型介绍

cosyvoice-v2
为 CosyVoice 的稳定版本,支持系统音色+复刻、LaTeX、时间戳、流式输入输出。
适用于需要兼顾稳定性与功能特性的业务场景。

适用场景

  • 教育内容朗读(含公式)
  • 需时间戳的语音处理场景
  • 历史项目升级与兼容

模型出入参

调用方式

  • generateSpeech
    :非流式,一次返回完整音频。
  • streamSpeech
    :流式,按句子事件返回音频分片。

请求参数(业务侧调用 SDK)

参数名
类型
必填
适用方式
说明
textstringgenerateSpeech / streamSpeech待合成文本
voicestringgenerateSpeech / streamSpeech音色 ID(需与 v2 版本匹配)
format"mp3" | "wav" | "pcm"generateSpeech / streamSpeech输出音频格式,默认
mp3
sampleRate8000 | 16000 | 22050 | 24000 | 44100 | 48000generateSpeech / streamSpeech采样率
volumenumbergenerateSpeech / streamSpeech音量(0~100),默认
50
ratenumbergenerateSpeech / streamSpeech语速(0.5~2.0),默认
1.0
pitchnumbergenerateSpeech / streamSpeech音调(0.5~2.0),默认
1.0
languageHintsstringgenerateSpeech / streamSpeech语言提示

参数约束(v2 版本)

  • 必填:
    text
    voice
  • v2 不包含
    instruction
    能力参数。
  • voice
    必须使用 v2 对应音色。

响应参数(SDK 统一输出)

generateSpeech
返回:

字段名
类型
说明
audioBuffer完整音频二进制
usage.charactersnumber字符计数

streamSpeech
返回
AsyncIterable<TTSStreamChunk>
,每个 chunk 包含:

字段名
类型
说明
audioBuffer音频分片(begin/end 事件可能为空)
event"sentence-begin" | "sentence-synthesis" | "sentence-end"句子事件类型
sentence.indexnumber句子序号
sentence.originalTextstring原始句子文本(部分事件返回)

内部协议说明

底层由 SDK 内部通过 WebSocket 协议调用,业务侧无需也不支持直连下游 API。

使用示例

cosyvoice-v2 基础 Agent 调用示例

javascript
const ttsModel = this.createModel("cosyvoice-v2");
const result = await ttsModel.generateSpeech({
  text: "这是 v2 版本语音示例。",
  voice: "longanli",
  format: "mp3",
});