跳转至

模型说明

seed-audio-1.0
纯文本生成音频
音频参考生成 ✅(最多 3 条参考音频)
图片参考生成 ✅(仅 1 张参考图;不可与音频参考混用)
单次输出上限 120 秒
text_prompt 上限 3000 字符

功能接口详情

语音合成(TTS Create)

请求 URL

POST https://genaiapi-m2.cloudsway.net/v1/ai/{endpoint}/seedaudio/tts/create
Header 是否必填 描述
Authorization Bearer {YOUR_AK}
Content-Type application/json

请求 Body 参数

参数名 字段类型 是否必填 描述
text_prompt string 待合成的提示词或文本。最大长度:3000 字符。
references array 参考资源。纯文本生成时可省略该字段。
audio_config object 输出音频配置。
watermark object 水印配置对象。可传空对象。

生成模式

  • 纯文本生成: 省略 references。API 根据 text_prompt 生成音频。

  • 音频参考生成: 通过 speakeraudio_dataaudio_url 提供音频参考。在 text_prompt 中按顺序使用 @Audio1@Audio2@Audio3 引用参考音频。

  • 图片参考生成: 通过 image_dataimage_url 提供一张参考图片。text_prompt 仅需包含待合成文本。

references[] 元素字段(参考规则)

参数名 字段类型 是否必填 描述 互斥规则
speaker string
音色 ID。可使用支持的豆包 TTS 音色或声音克隆音色 ID。 音频参考在 speakeraudio_dataaudio_url 中三选一。
audio_data string Base64 编码的参考音频。 speakeraudio_dataaudio_url 中三选一。
audio_url string 远程参考音频文件的 URL。
speakeraudio_dataaudio_url 中三选一。
image_data string
Base64 编码的参考图片。 image_dataimage_url 中二选一。不要将图片参考与音频参考混用。
image_url string 远程参考图片的 URL。 image_dataimage_url 中二选一。不要将图片参考与音频参考混用。

参考资源限制

  • 音频参考:每个请求最多 3 条。

  • 每条参考音频:最长 30 秒,且不超过 10 MB。

  • 支持的参考音频格式:wav、mp3、pcm、ogg_opus。

  • 图片参考:每个请求仅 1 张。

  • 参考图片大小:不超过 10 MB。

  • 支持的参考图片格式:jpeg、png、webp。

  • 同一请求中不可将图片参考与音频参考混用。

audio_config 字段(音频配置)

参数名 字段类型 是否必填 默认值 描述
format string wav 允许值:wav、mp3、pcm、ogg_opus
sample_rate int 24000 允许值:8000、16000、24000、32000、44100、48000
speech_rate int 0 取值范围:-50 到 100。100 表示 2.0 倍速;-50 表示 0.5 倍速。
loudness_rate int 0 取值范围:-50 到 100。100 表示 2.0 倍音量;-50 表示 0.5 倍音量。
pitch_rate int 0 取值范围:-12 到 12。

响应参数

参数名 字段类型 描述
code int 状态码。详情见官方错误码文档。
message string 状态详情。
audio string 生成的音频数据,Base64 编码。
duration float 经速度或后处理后的时长,单位:秒。
original_duration float 原始模型输出时长,单位:秒。用于计费,且上限为 120 秒。
url
string 临时音频 URL。官方说明有效期为 2 小时。

请求示例

纯文本生成

curl --request POST \
  --url 'https://genaiapi-m2.cloudsway.net/v1/ai/{endpoint}/seedaudio/tts/create' \
  --max-time 120 \
  --header 'Content-Type: application/json' \
  --header 'Authorization: Bearer {YOUR_AK}' \
  --data-raw '{
    "text_prompt": "Generate a short suspense radio drama in a late-night convenience store.",
    "audio_config": {
      "format": "mp3",
      "sample_rate": 48000,
      "pitch_rate": 0,
      "speech_rate": 0,
      "loudness_rate": 0
    },
    "watermark": {}
  }'

音频参考生成

{
  "text_prompt": "Use @Audio1 as the narrator voice and read the following line naturally: Welcome to the store.",
  "references": [
    {
      "audio_url": "https://example.com/reference.mp3"
    }
  ],
  "audio_config": {
    "format": "wav",
    "sample_rate": 24000,
    "speech_rate": 0,
    "loudness_rate": 0,
    "pitch_rate": 0
  },
  "watermark": {}
}

图片参考生成

{
  "text_prompt": "Read this scene description in a restrained suspense style.",
  "references": [
    {
      "image_url": "https://example.com/reference.png"
    }
  ],
  "audio_config": {
    "format": "wav",
    "sample_rate": 24000,
    "speech_rate": 0,
    "loudness_rate": 0,
    "pitch_rate": 0
  },
  "watermark": {}
}

响应示例

{
  "audio": "<base64-encoded-audio>",
  "duration": 3.52,
  "original_duration": 3.52,
  "url": "https://example.com/tmp/audio.wav"
}