小程序开放平台

文档中心
模型标准出入参
模型列表
文本模型
多模态(文生图&图片理解)
多模态(文档模态DOC、PDF)
图片编辑&人像风格
(Beta)TTS语音合成
cosyvoice-v1 模型介绍
cosyvoice-v2 模型介绍
cosyvoice-v3-flash 模型介绍
cosyvoice-v3-plus 模型介绍
cosyvoice-v3.5-flash 模型介绍
cosyvoice-v3.5-plus 模型介绍
CosyVoice 音色列表

cosyvoice-v3.5-flash 模型介绍

模型服务
>
模型列表
>
(Beta)TTS语音合成
>
cosyvoice-v3.5-flash 模型介绍
>
更新时间:2026-03-20 15:08:48

模型介绍

cosyvoice-v3.5-flash
是 v3.5 系列的低延迟版本,支持声音复刻、流式输入输出,主打性价比与响应速度。
适用于追求成本效率和实时性的语音交互场景。

说明:v3.5 系列当前仅在北京地域可用。

适用场景

  • 实时语音助手
  • 低延迟客服应答
  • 轻量播报类业务

模型出入参

调用方式

  • generateSpeech
    :非流式,一次返回完整音频。
  • streamSpeech
    :流式,按句子事件返回音频分片。

请求参数(业务侧调用 SDK)

参数名
类型
必填
适用方式
说明
textstringgenerateSpeech / streamSpeech待合成文本
voicestringgenerateSpeech / streamSpeech音色 ID(需与 v3.5-flash 版本匹配)
format"mp3" | "wav" | "pcm"generateSpeech / streamSpeech输出音频格式,默认
mp3
sampleRate8000 | 16000 | 22050 | 24000 | 44100 | 48000generateSpeech / streamSpeech采样率
volumenumbergenerateSpeech / streamSpeech音量(0~100),默认
50
ratenumbergenerateSpeech / streamSpeech语速(0.5~2.0),默认
1.0
pitchnumbergenerateSpeech / streamSpeech音调(0.5~2.0),默认
1.0
languageHintsstringgenerateSpeech / streamSpeech语言提示

参数约束(v3.5-flash 版本)

  • 必填:
    text
    voice
  • v3.5-flash 不包含
    instruction
    opus
    参数能力。
  • voice
    必须使用 v3.5-flash 对应音色。

响应参数(SDK 统一输出)

generateSpeech
返回:

字段名
类型
说明
audioBuffer完整音频二进制
usage.charactersnumber字符计数

streamSpeech
返回
AsyncIterable<TTSStreamChunk>
,每个 chunk 包含:

字段名
类型
说明
audioBuffer音频分片(begin/end 事件可能为空)
event"sentence-begin" | "sentence-synthesis" | "sentence-end"句子事件类型
sentence.indexnumber句子序号
sentence.originalTextstring原始句子文本(部分事件返回)

内部协议说明

底层由 SDK 内部通过 WebSocket 协议调用,业务侧无需也不支持直连下游 API。

使用示例

cosyvoice-v3.5-flash 基础 Agent 调用示例

javascript
const ttsModel = this.createModel("cosyvoice-v3.5-flash");
const result = await ttsModel.generateSpeech({
  text: "你好,这是一段低延迟语音播报。",
  voice: "your_voice_id",
  format: "mp3",
});