生成一段旁白已经很快了。难的是第二轮。

常见反馈很具体:这版有点机械,这里太赶,最后一句没落住。它们却很难直接交给下一次 TTS。人得重新打开时间线,找到是哪一句,又猜一遍该改文案、停顿还是时长。音色克隆解决了声音从哪里来,交付仍然需要有人处理节奏。

这就是 Voxr 出现的位置。它不生成声音。它读取生成后导出的 SRT,按用途检查字幕覆盖时长、相邻间隔、中文 CPM、英文 WPM 和相邻片段的速率变化。用户有授权时,也可以在浏览器本地加入对应音频,回听片段并查看 PCM 波形、样本峰值和 RMS。

Voxr 的本地复盘工作台,先选择旁白交付用途,再导入 SRT 与可选音频

最难交付的通常不是第一版

AI 视频里的旁白经常要经过几轮生成。第一版要确认音色,第二版才开始暴露节奏问题:一个定义塞得太满,一处停顿让画面断掉,连续几句速度突然变化。

这些问题不适合只用重新生成处理。每次重来都会带来新的变量:停顿变了,句长变了,音色也可能漂。更有效的做法是保留当前版本,标出一个可复核的时间点,再决定下一步动作。

Voxr 的报告把这个动作放在最前面。它不替一段配音下合格或不合格的结论,只提示建议优先复核的时间点。每条建议都带着时间码、可见的时间轴信号和一个可逆动作,例如拆分从句、延长字幕持续时间、检查一个长间隔是否真的服务画面。

下面是一次实际运行结果。页面导入项目内的英文 SRT 样本,未上传音频,默认使用中文界面。报告列出了时间轴覆盖、逐条 WPM、间隔分布和建议复核的具体片段。

Voxr 实际运行后的分析报告,包含时间轴、逐条语速、间隔分布与建议复核片段

SRT 是生成之后最轻的交接物

很多语音工具能输出音频,但在制作流程里,SRT 往往更容易被检查、修改和传给下一个人。它至少保留了三件事:说了什么、从什么时候开始、到什么时候结束。

这三件事不够判断情绪,也不能证明真实开口时长。它们足够让人发现值得回听的地方。Voxr 把 SRT 当作时间轴记录,不把字幕覆盖外的时间直接叫作静音,也不从波形推断音色、情绪或专业播音水平。

这个边界很重要。工具应当指出复核入口,听感判断仍然要回到人和实际画面。

把一次复盘交给下一步

网页端适合快速看一版旁白。做批量工作流时,Voxr 还可以导出 `voice-iteration-package.json`:里面保留用途、输入边界、解析告警、时间轴读数、优先复核项和通用重配提示词。

它没有直接调用任何 TTS 服务,也不会替用户操作音色克隆工具。这个交接包只是让下一步少猜一次:哪一段、为什么复核、先尝试什么改动。

开源仓库里还包含一个 Voxr Rhythm Review Skill,用于把这些证据边界带进 Agent 工作流。它要求区分 SRT 时间轴、已测得的本地 PCM 数据和听者主观反馈;机械感只保留为需要回听验证的假设,不作为自动诊断。

先把下一轮说清楚

合成旁白的工作不会因为一次生成结束。真正消耗时间的,是每一轮都在重新解释哪里不对。

Voxr 目前只做一个很小的动作:把这句话落到时间码、可回听的证据和可撤回的修改建议上。对于需要频繁重配的 AI 视频工作流,这一步已经足够有用。

打开 Voxr · 查看开源仓库