4. 语音体验中心


「语音体验中心」是阶跃星辰专为语音交互场景打造的综合功能区,集成了语音通话、语音识别、语音合成等多种语音相关能力。点击主界面输入框下方的「语音体验中心」入口即可进入能够满足日常沟通、内容创作、学习辅助等多元需求。

进入后,左侧边栏提供六大子功能入口:语音合成、语音复刻、语音识别、语音推理、声音编辑、语音对话。

语音合成

语音合成支持将文字内容转换为自然流畅的音频文件。

支持的语言:普通话、四川话俚语、粤语俚语、英文、日文

右侧控制面板说明

  • 模型:默认使用 stepaudio--2-tts,阶跃星辰自研语音合成模型
  • 格式:输出音频格式,默认 mp3
  • 音色:可选择系统音色或自定义克隆音色,内置多种风格(如「气质温婉」「沉稳男声」等)

适用场景示例

在全局控制的输入框里描述期望的语音效果后输入文本:
"亲爱的旅客朋友们,欢迎乘坐本次列车,
 请注意保管好随身携带的物品,祝您旅途愉快。"

配置:系统音色 > 气质温婉,格式 mp3
→ 生成一段播报风格的标准普通话音频

输出结果如下:

提示:语音合成每天有50次免费额度。

语音复刻

「语音复刻」支持录制用户的声音样本,AI 会学习声音特征,生成一个专属的克隆音色。

克隆完成后,该音色会出现在语音合成的音色选择列表中,可以直接用于后续的文字转语音任务——让 AI 用你自己的声音来朗读内容。

适用场景:个人播客配音、视频博主批量配音、个性化语音提醒等。

提示:复刻的声音最多能保存5个。

语音推理

「语音推理」支持直接输入语音或上传音频文件,让 AI 对语音内容进行理解和推理分析。相较于普通语音识别(只做转写),语音推理会在理解语音内容的基础上进一步给出分析、判断或回答。

适用场景示例

语音输入:
"一列火车从 A 城出发,时速 120 公里,
 另一列从 B 城出发,时速 80 公里,
 两城相距 600 公里,问几小时后相遇?"

→ AI 理解题意后直接给出解题步骤和答案,无需手动打字

输出结果如下:

提示:语音推理每天有50次试用次数,上传和录制的音频需小于240秒。

语音识别

「语音识别」功能支持将音频内容快速、准确地转写为文字,提供音频文件识别录音转写两种模式,支持中英文混合识别,无需手动切换语言。

1. 音频文件识别

用户可直接通过点击或拖拽的方式上传本地音频文件进行文字转写。

  • 适用场景:会议纪要整理、采访录音转写、课程内容归档、语音备忘录提取、客服录音质检。
  • 支持格式:WAV、MP3、OGG、PCM、M4A。
  • 文件限制:单文件大小不超过 20MB

上传客户需求记录的音频,识别结果如下:

2. 录音转写

支持通过麦克风实时录入语音,并在停止录音后由系统自动识别并输出转写结果。

  • 适用场景:快速语音备忘、现场会议纪要、口述内容转文字、语音笔记收集。
  • 录音时长限制:单次录音最长 2分钟

💡 提示:语音识别功能与语音合成、语音推理等共享语音体验中心的每日试用额度,使用时请注意剩余次数(如界面左下方显示的今日试用次数)。

声音编辑

「声音编辑」提供对已生成或上传音频的二次加工能力,支持调整情绪、风格、速度,以及添加副语言效果。

操作流程

点击添加音频。

上传或录制音频。

点击左下角选择参数,共有三个分类可以选择,情绪、风格、速度控制。(一次只能选择一个分类,需要等编辑完成后才能选择另一个分类),选择完成后点击「编辑新音频」。

编辑完成后可以再次点击选择参数再次编辑。

用户还可以点击左下角「副语言」按钮为音频添加副语言。

选择好要添加副语言的位置。

点击左下角「副语言」选择副语言的类型。

选择后即可在选择的位置添加上副语言。

编辑完成后可以点击「下载」按钮即可下载。

原始音频

添加情绪

添加副语言

提示:声音编辑每天有20次编辑次数,且上传和录制的音频需小于30秒。

语音对话

「语音对话」支持与 AI 进行充满临场感的角色陪伴体验——你说话,AI 听懂后以语音回答,把聊天变成有情绪、有氛围的角色互动。最新版本引入了强大的右侧配置面板,支持深度定制“系统提示词”,并带来了更丰富的音色库选择。

1. 实时语音人格互动对话

点击页面中央的「实时对话」按钮,即可一键开启实时语音通话。

  • 在通话过程中,AI 具有极高的响应速度,不仅能感知情绪,还支持在对话中原生触发 Tool Call(工具调用) 动态(如联网检索、复杂推理等),此时界面中央会呈现智能的蓝色云朵通话状态和 </> Tool Call 标签提示。
  • 额度说明:中央下方直观显示当天的体验次数,如 今日试用次数:0/50

2. 右侧参数设置面板

在点击通话前,用户可以在右侧面板对语音助手的“灵魂”与“声音”进行全方位的深度定制:

  • 系统提示词(人设介绍)

    • 默认人设:系统默认提供“小跃”人设(由阶跃星辰打造的语音对话助手,热情鲜活、商商在线、能共情、脑子清醒,偶有些小傲娇)。
    • 自定义系统提示词:支持在输入框内自由编写或修改详细的系统提示词(System Prompt)。你可以向 AI 灌输基础信息、核心身份、对话定位(例如:要求它主动引导对话、用通俗具象的例子阐释观点、提供精准的高质量选项等),彻底改变它的聊天风格。
  • 音色选择(音色库 / 复刻音色)

    点击音色下拉菜单,可以切换两种音色来源:

    • 音色库:内置多款极具特色的人格化音色:

      • 小跃:温暖、清澈、灵动
      • 小队:温暖、阳光、真挚
      • 田菲菲:甜美、软糯、可爱
      • 小鱼儿:独特、透亮
      • 苏焓言:慵懒、随性
      • 萧砚:低沉、平静、克制

    • 复刻音色:可以直接将下拉分类切换为「复刻音色」,选用您在“语音复刻”中克隆出来的专属个人音色。

  • 添加音频: 面板最下方新增了「+ 添加音频」按钮,允许用户在配置音色和人设时,手动上传或录制本地音频来辅助对话的表现。

使用方法

  1. 进入「语音对话」功能,在右侧面板的「系统提示词」中自定义助手的人设。
  2. 在音色下拉框中选择「音色库」里的内置角色(如小跃、田菲菲等),或切换至「复刻音色」。
  3. (可选)点击下方的「+ 添加音频」上传或录制参考音频。
  4. 确认无误后,点击界面中央的「实时对话」按钮,即可开始多轮无缝的语音交流。

适用场景

  • 双手不方便打字时(如驾车、做饭、运动或通勤)。
  • 希望获得更自然、更有情感温度和氛围感的角色陪伴。
  • 语言学习口语练习,利用自定义提示词让 AI 扮演特定的对话外教。

使用建议

  • 在安静环境下使用,语音识别准确率更高
  • 说话语速适中,避免过长的无停顿单句
  • 若识别结果有误,可手动修正后继续对话

💡 提示:语音对话过程中无法动态调整右侧的参数设置。如需更换音色或修改提示词,请在结束当前实时通话后,在主界面配置完成后重新发起。

评论

0
还没有评论,来写第一条吧