返回音频创作

🎙️ 语音合成(音色设计)

输入文字描述想要的声音(性别、年龄、音色、语速等),AI自动生成专属音色并合成语音

🎙️

合成设置

预计消耗3 积分
🎵

生成结果

🎙️

输入音色描述后点击生成

✨ 音色描述编写指南

写好音色描述,让 AI 生成你想要的声音

💡

什么是音色描述?

音色描述是你用文字告诉 AI 你想要什么样的声音。描述越具体、越生动,生成的音色越贴近预期。1-4 句即可,核心特征描述清楚比堆砌维度更重要。

✓ 好的描述:年轻女性,温柔治愈系,语速偏慢,声音甜美空灵

✗ 太模糊:普通的女声

👤
性别与年龄

声音的基本属性

"young woman in her mid-20s"

"五十多岁的中年男性"

"活泼的青少年"

🎵
音色质感

声音的质感与风格

"deep and gravelly"(低沉沙哑)

"丝滑醇厚、带着磁性"

"清亮空灵"

💨
情绪与语速

语气与节奏

"warm and confident"(温暖自信)

"slow and deliberate"(缓慢沉稳)

"语速极快,像连珠炮"

🎭
角色与人设

赋予声音一个身份

narrator(旁白)

podcast host(播客主持)

评书先生、深夜电台DJ

🎬
场景描写

设定说话的情境

"narrating a nature documentary"

"在给投资人路演"

"1940s film noir"(黑色电影风格)

🗣️
说话风格

口语化的细节

"casual and colloquial"(随意口语)

"一本正经地"

"压低嗓音像在密谋"

📻
年代参照

赋予声音时代感

"1940s film noir"(四十年代黑色电影)

"八十年代译制片配音"

✍️

写法建议

两种写法,按需选择

简洁描述型

用关键词或一句话快速勾勒声音轮廓

Heavy Russian accent, gruff middle-aged male, blunt and matter-of-fact.

专业描述型

通过场景、人设或多维度细节立体刻画声音

Young female, extreme close-up with a binaural, ear-to-ear ASMR feel. Audible breathing, subtle swallowing, and soft natural lip sounds. She speaks very slowly, creating a deeply relaxing and immersive experience.

一位年迈的老先生,说带北方口音的普通话,语速缓慢而沉稳,嗓音略带沙哑和沧桑感,仿佛一位饱经风霜的老爷爷在讲故事,充满岁月的智慧。

⚠️

注意事项与使用技巧

✅ 推荐做法

• 1-4 句话,核心特征描述清楚比堆砌维度更重要
• 多个维度组合描述更立体
• 中英文均可,选你最能精确表达的语言
• 合成文本应与音色描述相匹配,才能获得最佳效果
• 建议使用 LLM 根据音色描述自动生成适配文本
• 留空合成文本时,开启智能润色自动生成

❌ 避免这样做

• 避免矛盾特征(如"稚嫩的童声 + CEO 气场")
• 避免音质效果词(混响、回声、EQ、压缩等后期处理描述)
• 避免模糊词("普通的"、"正常的"、"外国的"等缺乏具体指向的描述)
• 不需要写长篇大论,简洁精准更重要