为看不见画面的听众写作
从重要行动开始:有人到来、熟悉的地方听起来变了,或角色作出选择。提供足够背景,使听众能够跟上故事,无需描述所有视觉细节。使用简短的口语句子,生成前先读一遍。如果台词依赖一个动作,就改写为能通过对白、旁白或声音事件理解的表达。
用一致标记区分旁白和角色对白。让每个场景承担一个小的戏剧任务,不必把完整情节塞入一条指令。Foleyix 每次生成最多接受 3,000 字符的总输入。较小的场景能留出角色指令空间,也更容易修改需要调整的具体时刻。
让角色与声音承担不同任务
用合成角色让对话更容易区分,并试听保存的样本。每个片段最多选择三个已准备好的角色。描述会影响故事的声音细节:打断交谈的门响、逐渐接近的脚步,或让房间显得封闭的雨声。声音场景可以同时请求人声和环境;独立音效或环境声片段,则提供可顺序编排的单独音频。
在编排中,找到故事节奏
先检查是否听得清,再判断演绎和氛围。比较同一片段的不同版本,选定最适合场景的一版。按顺序编排音频,在地点、说话者或情绪转换处调整停顿。模型支持播客内容单次最多四分钟,其他音频最多两分钟;整期导出包括停顿在内最长 30 分钟。可导出 WAV、MP3,或包含已处理独立 WAV 片段、脚本与编排清单的 ZIP,分享前请审听完整音频。