模型说明
| seed-audio-1.0 | |
|---|---|
| 纯文本生成音频 | ✅ |
| 音频参考生成 | ✅(最多 3 条参考音频) |
| 图片参考生成 | ✅(仅 1 张参考图;不可与音频参考混用) |
| 单次输出上限 | 120 秒 |
text_prompt 上限 |
3000 字符 |
功能接口详情
语音合成(TTS Create)
请求 URL
请求 Header
| Header | 是否必填 | 描述 |
|---|---|---|
| Authorization | 是 | Bearer {YOUR_AK} |
| Content-Type | 是 | application/json |
请求 Body 参数
| 参数名 | 字段类型 | 是否必填 | 描述 |
|---|---|---|---|
| text_prompt | string | 是 | 待合成的提示词或文本。最大长度:3000 字符。 |
| references | array | 否 | 参考资源。纯文本生成时可省略该字段。 |
| audio_config | object | 否 | 输出音频配置。 |
| watermark | object | 否 | 水印配置对象。可传空对象。 |
生成模式
-
纯文本生成: 省略
references。API 根据text_prompt生成音频。 -
音频参考生成: 通过
speaker、audio_data或audio_url提供音频参考。在text_prompt中按顺序使用@Audio1、@Audio2、@Audio3引用参考音频。 -
图片参考生成: 通过
image_data或image_url提供一张参考图片。text_prompt仅需包含待合成文本。
references[] 元素字段(参考规则)
| 参数名 | 字段类型 | 是否必填 | 描述 | 互斥规则 |
|---|---|---|---|---|
| speaker | string |
否 | 音色 ID。可使用支持的豆包 TTS 音色或声音克隆音色 ID。 | 音频参考在 speaker、audio_data、audio_url 中三选一。 |
| audio_data | string | 否 | Base64 编码的参考音频。 | 在 speaker、audio_data、audio_url 中三选一。 |
| audio_url | string | 否 | 远程参考音频文件的 URL。 |
在 speaker、audio_data、audio_url 中三选一。 |
| image_data | string |
否 | Base64 编码的参考图片。 | 在 image_data 或 image_url 中二选一。不要将图片参考与音频参考混用。 |
| image_url | string | 否 | 远程参考图片的 URL。 | 在 image_data 或 image_url 中二选一。不要将图片参考与音频参考混用。 |
参考资源限制
-
音频参考:每个请求最多 3 条。
-
每条参考音频:最长 30 秒,且不超过 10 MB。
-
支持的参考音频格式:wav、mp3、pcm、ogg_opus。
-
图片参考:每个请求仅 1 张。
-
参考图片大小:不超过 10 MB。
-
支持的参考图片格式:jpeg、png、webp。
-
同一请求中不可将图片参考与音频参考混用。
audio_config 字段(音频配置)
| 参数名 | 字段类型 | 是否必填 | 默认值 | 描述 |
|---|---|---|---|---|
| format | string | 否 | wav | 允许值:wav、mp3、pcm、ogg_opus |
| sample_rate | int | 否 | 24000 | 允许值:8000、16000、24000、32000、44100、48000 |
| speech_rate | int | 否 | 0 | 取值范围:-50 到 100。100 表示 2.0 倍速;-50 表示 0.5 倍速。 |
| loudness_rate | int | 否 | 0 | 取值范围:-50 到 100。100 表示 2.0 倍音量;-50 表示 0.5 倍音量。 |
| pitch_rate | int | 否 | 0 | 取值范围:-12 到 12。 |
响应参数
| 参数名 | 字段类型 | 描述 |
|---|---|---|
| code | int | 状态码。详情见官方错误码文档。 |
| message | string | 状态详情。 |
| audio | string | 生成的音频数据,Base64 编码。 |
| duration | float | 经速度或后处理后的时长,单位:秒。 |
| original_duration | float | 原始模型输出时长,单位:秒。用于计费,且上限为 120 秒。 |
| url |
string | 临时音频 URL。官方说明有效期为 2 小时。 |
请求示例
纯文本生成
curl --request POST \
--url 'https://genaiapi-m2.cloudsway.net/v1/ai/{endpoint}/seedaudio/tts/create' \
--max-time 120 \
--header 'Content-Type: application/json' \
--header 'Authorization: Bearer {YOUR_AK}' \
--data-raw '{
"text_prompt": "Generate a short suspense radio drama in a late-night convenience store.",
"audio_config": {
"format": "mp3",
"sample_rate": 48000,
"pitch_rate": 0,
"speech_rate": 0,
"loudness_rate": 0
},
"watermark": {}
}'
音频参考生成
{
"text_prompt": "Use @Audio1 as the narrator voice and read the following line naturally: Welcome to the store.",
"references": [
{
"audio_url": "https://example.com/reference.mp3"
}
],
"audio_config": {
"format": "wav",
"sample_rate": 24000,
"speech_rate": 0,
"loudness_rate": 0,
"pitch_rate": 0
},
"watermark": {}
}
图片参考生成
{
"text_prompt": "Read this scene description in a restrained suspense style.",
"references": [
{
"image_url": "https://example.com/reference.png"
}
],
"audio_config": {
"format": "wav",
"sample_rate": 24000,
"speech_rate": 0,
"loudness_rate": 0,
"pitch_rate": 0
},
"watermark": {}
}