All models

s2-pro

Fish AudioAudio
110.28 Credits
Get your API key
s2-pro

为台词、解说与品牌声音增添表现力

Fish Audio S2 Pro 是用于自然语音合成与声音克隆的文本转语音模型,适合广告解说、角色台词和需要明显表达节奏的内容。平台指南强调其表现力,并将它设为本入口的默认型号。通过统一文本、参考声音和韵律设置,开发者可以把配音制作纳入应用与内容工作流。

Fish Audio模型品牌
文本转语音模型类型
声音克隆任务能力

规格与接口特性

在选型前明确型号、输入输出与调用方式。

模型选择
HTTP 请求头 model: s2-pro
平台接口
POST /fish/tts;text 为必填输入
音频交付
同步返回 audio_url;支持 callback_url 异步回调
输出格式
mp3、wav、pcm;wav 与 pcm 均返回 WAV 容器
声音参考
reference_id 或单个 references 样本,二者互斥
韵律控制
prosody.speed 控制语速,prosody.volume 控制音量增益

能力描述结合公开模型资料与本平台文档;实际参数、输出和计费规则以对应 API 和定价栏目为准。

核心能力

了解 s2-pro 适合解决的声音任务。

关注声音的表达节奏

台词的标点、停顿和句式会影响声音表现。S2 Pro 适合在短样中比较讲述方式,先确认重点和节奏,再扩展到完整文稿;模型的表达定位不等于能够精确执行每一种情绪标记。

从参考声音建立角色感

既可通过 reference_id 沿用保存的声音,也可使用录音与准确逐字稿进行一次性克隆。前者适合固定角色,后者适合单次配音项目,两种方式需要择一使用。

兼顾试听与应用交付

使用 MP3 做网页播放或快速审听,使用 WAV 容器进入编辑环节。同步完成后通过 audio_url 获取结果,较长任务也可配置回调,将等待过程接入任务列表。

适用场景

从具体内容和交付方式出发选择。

短视频与广告解说

将产品卖点、转场和结尾拆成短段,比较语速与文稿措辞对表达的影响。确认效果后再制作完整片段,并对照画面检查时长和停顿。

角色台词与互动内容

为固定角色选择可重复调用的声音,围绕真实台词检查一致性。应用负责角色编排与音频拼接,单个 TTS 请求不能直接等同于自动多角色制作。

品牌讲述与产品演示

把功能说明、品牌故事和引导文案合成为统一声音。保留试听稿与成片的对应关系,方便文案修改后局部替换,而不必重做整个视频。

如何选择这个模型

结合文稿、音色与制作成本进行比较。

默认型号也应明确记录

未设置 model 请求头时,平台使用 s2-pro。正式制作建议仍显式指定型号,避免测试稿和后续内容因设置变化而混用不同模型。

比较表达性与新一代能力

可以将同一段台词、同一音色交给 S2 Pro 与 S2.1 Pro 对比,关注语句自然度、生成等待和后续修订量。更关注长文稳定性时,再加入 S1 作为候选。

开始使用

先试听,再扩展到正式内容。

准备文稿与声音

明确朗读目的,校对文稿,选择保存音色或准备参考录音与逐字稿。

生成短样并校听

显式指定 s2-pro,用代表性段落确认发音、节奏和输出格式。

接入制作工作流

保存设置和任务编号,在完成后取得音频链接,再安排播放、剪辑或内容交付。

使用边界

了解合成方式与交付范围。

  • 此入口用于文本转语音,不等同于语音识别、音乐生成或原生实时音频流。长篇内容应分段制作并安排校听,检查数字、缩写与专有名词。
  • 一次性克隆仅接受一个公开 HTTPS MP3/WAV 录音样本及其准确逐字稿,不接受 Base64、data URI 或带凭据的 URL;不会自动保存长期音色。
  • format=pcm 返回 WAV 容器,不能直接作为裸 PCM 字节处理;opus 不受支持。生成参数的支持范围和实际计费请查看本平台 API 文档与定价。

常见问题

解答使用 s2-pro 时的常见疑问。

S2 Pro 是平台默认模型吗?

是。本平台 Fish TTS 入口在未设置 model 请求头时默认 s2-pro。建议生产任务显式记录型号;官方推荐的最新型号与本入口默认型号是两个不同的信息。

型号应该写在哪里?

通过 HTTP 请求头 model 指定 s2-pro。不指定时默认 s2-pro;音色 reference_id 属于声音选择,与合成型号分别设置。

保存声音与一次性克隆怎么选?

固定角色或系列内容可用 reference_id 复用声音;单次项目可以用 references 提供录音与逐字稿。两者互斥,一次性克隆只接受一个参考样本。

怎样控制语速和输出格式?

prosody.speed=1.0 表示原速,volume 使用 dB,0 表示不改变音量。可选择 mp3、wav 或 pcm;后两者都使用 WAV 容器,MP3 码率可选 64、128 或 192。

长稿怎样跟踪完成结果?

设置 callback_url 后先保存 task_id 和 started_at,等待完成回调,也可按任务编号查询。取得 audio_url 才表示可以进入播放或编辑环节。

模型资料 · 更新日期:2026-10-01。调用参数与计费规则请查看 API 和定价栏目。

把 s2-pro 用到你的下一项配音任务

从代表性文稿开始,在试听与实际交付中判断它是否适合。