参数名 | 类型 | 必填 | 适用方式 | 说明 |
|---|---|---|---|---|
| text | string | 是 | generateSpeech / streamSpeech | 待合成文本 |
| voice | string | 是 | generateSpeech / streamSpeech | 音色 ID(需与 v1 版本匹配) |
| format | "mp3" | "wav" | "pcm" | 否 | generateSpeech / streamSpeech | 输出音频格式,默认 mp3 |
| sampleRate | 8000 | 16000 | 22050 | 24000 | 44100 | 48000 | 否 | generateSpeech / streamSpeech | 采样率 |
| volume | number | 否 | generateSpeech / streamSpeech | 音量(0~100),默认 50 |
| rate | number | 否 | generateSpeech / streamSpeech | 语速(0.5~2.0),默认 1.0 |
| pitch | number | 否 | generateSpeech / streamSpeech | 音调(0.5~2.0),默认 1.0 |
| languageHints | string | 否 | generateSpeech / streamSpeech | 语言提示 |
字段名 | 类型 | 说明 |
|---|---|---|
| audio | Buffer | 完整音频二进制 |
| usage.characters | number | 字符计数 |
字段名 | 类型 | 说明 |
|---|---|---|
| audio | Buffer | 音频分片(begin/end 事件可能为空) |
| event | "sentence-begin" | "sentence-synthesis" | "sentence-end" | 句子事件类型 |
| sentence.index | number | 句子序号 |
| sentence.originalText | string | 原始句子文本(部分事件返回) |
底层由 SDK 内部通过 WebSocket 协议调用,业务侧无需也不支持直连下游 API。
const ttsModel = this.createModel("cosyvoice-v1");
const result = await ttsModel.generateSpeech({
text: "这是 v1 版本语音示例。",
voice: "longwan",
format: "mp3",
});