先决定,听众应该听见什么
自由描述你的想法,或从旁白、对白、播客、声音场景、音效与环境声的可选模板开始,编辑建议提示词。讲解与清晨的空旷森林需要不同指令。先说明核心事件,再补充声音、情绪及声学环境。聚焦的请求,也能让你更清楚地判断结果是否符合需求。
生成语音时,写出需要说出的台词,并保持角色名一致。纯声音片段应明确不要人声,再描述事件顺序。使用清楚的指令,避免堆叠相互冲突的形容词。每次请求的总输入,包括所选角色指令,最多为 3,000 字符。
试听、比较,每次修改一个要点
生成第一版后,检查发音、节奏、角色切换以及意外声音。尝试新指令时,保留早先版本以供比较。如果停顿太急,就调整演绎指令;如果场景太拥挤,就减少事件。每次只修改一个关键细节,有助于更有效地比较不同版本。
生成前,写下判断片段成功的关键细节:可能是听得清的问题、克制的情绪变化,或干净的纯声音结尾。这个具体的审听目标,有助于决定保留当前版本、改写指令,还是继续下一个片段。
用短片段,编排完整作品
将较长内容拆成可以独立审听的片段。模型支持播客内容单次最多四分钟,其他音频最多两分钟。这些是上限,实际结果可能更短。按顺序编排所选版本、调整片段间停顿,导出包括停顿在内最长 30 分钟的 WAV 或 MP3 节目。片段 ZIP 包含已处理的独立 WAV 片段、脚本与编排清单,便于继续编辑。