Skip to content

工作流程

VideoCaptioner 将“字幕内容处理”和“字幕样式呈现”分开。各阶段交换字幕文本、 时间轴和单双语结构;SRT 是默认阶段交付格式,ASS/VTT 在导出或视频合成时生成。

完整流程

text
音视频输入
  → ASR 转录与字词级对齐
  → 本地聚合或 LLM 语义断句
  → 字幕优化
  → 非 LLM / 单 LLM / 双角色 LLM 翻译
  → 字幕后处理与质量审计
  → 软字幕封装或硬字幕合成

      【转录字幕】SRT

      【初版字幕】SRT + 可选术语表/翻译审计

      【后处理字幕】SRT + 可选 QA/时间证据

字幕后处理在完整 workflow 中默认开启,但可以关闭。它接收已经完成优化、翻译和前置 断句的初版字幕,再进行标点清理、短间隙闭合、单句时长治理、时间轴平滑、 阅读速度优化、可选语义修复和质量审计。 后处理失败时保留初版字幕,并允许后续阶段继续使用初版结果。

完整 workflow 在内存中把字幕数据直接传给下一个模块,不会为了阶段交付而反复读取 刚写出的 SRT。与此同时,每个实际完成的字幕阶段都必须保存一份规范 SRT 检查点, 便于用户查看结果或从某个阶段手动恢复工作。

转录与时间证据

MiMo 与 Qwen 路线可以使用 Qwen3-ForcedAligner 生成字词级时间戳。VAD 只负责 识别语音范围、寻找分块边界和跳过静音,不等同于词级对齐。对齐异常会先重试或拆分 窗口,仍失败时才生成受语音区间约束的降级时间轴,并在阶段摘要中明确标记。

翻译产物

增强型翻译在初版字幕之外还会生成:

  • .vcglossary.json 项目术语表
  • Markdown 翻译审计报告,内附按角色与阶段汇总的 token usage

必要翻译阶段失败时不会把部分结果当作成功,也不会继续进入后处理。完整说明见 翻译模式与双角色校对

阶段自动导出

任务创建页和批处理页提供一个“每个字幕阶段自动导出”开关。启用后,可统一选择 ASS 或 VTT;每个实际完成的字幕阶段都会额外导出一次,并使用相同的格式、布局和样式。 这些设置会在任务开始时冻结,避免长任务执行期间修改设置导致各阶段成品不一致。

  • 规范 SRT 始终保存,不能关闭。
  • ASS/VTT 自动导出失败只产生警告,不撤销已经成功的 SRT 阶段结果。
  • ASS 使用当前字幕样式设置;VTT 不使用 ASS 样式。
  • 文件通过 【转录字幕】【初版字幕】【后处理字幕】 前缀区分。

单独处理已有字幕

不运行完整 workflow 时,可以按需使用独立页面:

  1. 在“字幕优化与翻译”页面导入字幕,完成前置拆分、断句、优化和翻译,得到初版 SRT。
  2. 在“字幕后处理”页面导入已经成型的字幕,调整速度、时间轴和文本清理。
  3. 保存规范 SRT 工作稿,或按需导出 ASS/VTT 等观看格式。

后处理不会回到上游重新执行翻译或字数上限断句。它可以大幅重组已经交付的字幕, 但只在用户开启相应能力时进行。详细说明见字幕后处理

合成与导出

软字幕通过 FFmpeg 流复制快速封装;ASS 硬烧和圆角背景使用集中编码引擎。GUI 可以检测 硬字幕编码器是否真正能在当前硬件初始化,预览命令并控制运行;CLI 可为硬字幕打印命令 或透传额外参数,并提供原始命令入口。详细说明见 FFmpeg 合成导出


相关文档:

个人使用向 fork · GPL-3.0