4. 语音体验中心

「语音体验中心」是阶跃星辰专为语音交互场景打造的综合功能区,集成了语音通话、语音识别、语音合成等多种语音相关能力。点击主界面输入框下方的「语音体验中心」入口即可进入能够满足日常沟通、内容创作、学习辅助等多元需求。

进入后,左侧边栏提供六大子功能入口:语音合成、语音复刻、语音识别、语音推理、声音编辑、语音对话。
语音合成
语音合成支持将文字内容转换为自然流畅的音频文件。
支持的语言:普通话、四川话俚语、粤语俚语、英文、日文
右侧控制面板说明:
- 模型:默认使用
stepaudio--2-tts,阶跃星辰自研语音合成模型 - 格式:输出音频格式,默认 mp3
- 音色:可选择系统音色或自定义克隆音色,内置多种风格(如「气质温婉」「沉稳男声」等)
适用场景示例:
输出结果如下:
提示:语音合成每天有50次免费额度。
语音复刻

「语音复刻」支持录制用户的声音样本,AI 会学习声音特征,生成一个专属的克隆音色。

克隆完成后,该音色会出现在语音合成的音色选择列表中,可以直接用于后续的文字转语音任务——让 AI 用你自己的声音来朗读内容。
适用场景:个人播客配音、视频博主批量配音、个性化语音提醒等。
提示:复刻的声音最多能保存5个。
语音推理
「语音推理」支持直接输入语音或上传音频文件,让 AI 对语音内容进行理解和推理分析。相较于普通语音识别(只做转写),语音推理会在理解语音内容的基础上进一步给出分析、判断或回答。
适用场景示例:
输出结果如下:

提示:语音推理每天有50次试用次数,上传和录制的音频需小于240秒。
语音识别

「语音识别」功能支持将音频内容快速、准确地转写为文字,提供音频文件识别与录音转写两种模式,支持中英文混合识别,无需手动切换语言。
1. 音频文件识别

用户可直接通过点击或拖拽的方式上传本地音频文件进行文字转写。
- 适用场景:会议纪要整理、采访录音转写、课程内容归档、语音备忘录提取、客服录音质检。
- 支持格式:WAV、MP3、OGG、PCM、M4A。
- 文件限制:单文件大小不超过 20MB。
上传客户需求记录的音频,识别结果如下:

2. 录音转写

支持通过麦克风实时录入语音,并在停止录音后由系统自动识别并输出转写结果。
- 适用场景:快速语音备忘、现场会议纪要、口述内容转文字、语音笔记收集。
- 录音时长限制:单次录音最长 2分钟。
💡 提示:语音识别功能与语音合成、语音推理等共享语音体验中心的每日试用额度,使用时请注意剩余次数(如界面左下方显示的今日试用次数)。
声音编辑
「声音编辑」提供对已生成或上传音频的二次加工能力,支持调整情绪、风格、速度,以及添加副语言效果。
操作流程:

点击添加音频。

上传或录制音频。

点击左下角选择参数,共有三个分类可以选择,情绪、风格、速度控制。(一次只能选择一个分类,需要等编辑完成后才能选择另一个分类),选择完成后点击「编辑新音频」。

编辑完成后可以再次点击选择参数再次编辑。

用户还可以点击左下角「副语言」按钮为音频添加副语言。

选择好要添加副语言的位置。

点击左下角「副语言」选择副语言的类型。

选择后即可在选择的位置添加上副语言。

编辑完成后可以点击「下载」按钮即可下载。
原始音频
添加情绪
添加副语言
提示:声音编辑每天有20次编辑次数,且上传和录制的音频需小于30秒。
语音对话
「语音对话」支持与 AI 进行充满临场感的角色陪伴体验——你说话,AI 听懂后以语音回答,把聊天变成有情绪、有氛围的角色互动。最新版本引入了强大的右侧配置面板,支持深度定制“系统提示词”,并带来了更丰富的音色库选择。
1. 实时语音人格互动对话

点击页面中央的「实时对话」按钮,即可一键开启实时语音通话。
- 在通话过程中,AI 具有极高的响应速度,不仅能感知情绪,还支持在对话中原生触发 Tool Call(工具调用) 动态(如联网检索、复杂推理等),此时界面中央会呈现智能的蓝色云朵通话状态和
</> Tool Call标签提示。 - 额度说明:中央下方直观显示当天的体验次数,如
今日试用次数:0/50。
2. 右侧参数设置面板
在点击通话前,用户可以在右侧面板对语音助手的“灵魂”与“声音”进行全方位的深度定制:
-
系统提示词(人设介绍):
- 默认人设:系统默认提供“小跃”人设(由阶跃星辰打造的语音对话助手,热情鲜活、商商在线、能共情、脑子清醒,偶有些小傲娇)。
- 自定义系统提示词:支持在输入框内自由编写或修改详细的系统提示词(System Prompt)。你可以向 AI 灌输基础信息、核心身份、对话定位(例如:要求它主动引导对话、用通俗具象的例子阐释观点、提供精准的高质量选项等),彻底改变它的聊天风格。
-
音色选择(音色库 / 复刻音色):

点击音色下拉菜单,可以切换两种音色来源:
-
音色库:内置多款极具特色的人格化音色:
小跃:温暖、清澈、灵动小队:温暖、阳光、真挚田菲菲:甜美、软糯、可爱小鱼儿:独特、透亮苏焓言:慵懒、随性萧砚:低沉、平静、克制

-
复刻音色:可以直接将下拉分类切换为「复刻音色」,选用您在“语音复刻”中克隆出来的专属个人音色。
-
-
添加音频: 面板最下方新增了「+ 添加音频」按钮,允许用户在配置音色和人设时,手动上传或录制本地音频来辅助对话的表现。
使用方法:
- 进入「语音对话」功能,在右侧面板的「系统提示词」中自定义助手的人设。
- 在音色下拉框中选择「音色库」里的内置角色(如小跃、田菲菲等),或切换至「复刻音色」。
- (可选)点击下方的「+ 添加音频」上传或录制参考音频。
- 确认无误后,点击界面中央的「实时对话」按钮,即可开始多轮无缝的语音交流。
适用场景:
- 双手不方便打字时(如驾车、做饭、运动或通勤)。
- 希望获得更自然、更有情感温度和氛围感的角色陪伴。
- 语言学习口语练习,利用自定义提示词让 AI 扮演特定的对话外教。
使用建议:
- 在安静环境下使用,语音识别准确率更高
- 说话语速适中,避免过长的无停顿单句
- 若识别结果有误,可手动修正后继续对话
💡 提示:语音对话过程中无法动态调整右侧的参数设置。如需更换音色或修改提示词,请在结束当前实时通话后,在主界面配置完成后重新发起。

评论
0 条