字幕翻译和视频翻译不是一回事:一条视频的两种本地化路径

2026年09月02日 18:7

很多团队第一次做多语言内容时,会把"视频翻译"默认理解成"加一层字幕"。这两个词经常被混用,但它们指向的是两条完全不同的技术路径,交付物不同、成本结构不同、失效的边界也不同。

选错的代价不只是效果打折扣,而是返工——先做了字幕版本,后来发现目标市场的用户根本不读字幕,整套流程要重来一遍。

这篇文章把两条路径拆开讲清楚:它们各自做了什么、各自的技术约束在哪里、什么情况下该用哪一条,以及两者怎么组合。

一、两条路径,交付的是两种不同的东西

字幕翻译替换的是文字层。原音轨保持不变,把对白转成目标语言的文字,按时间轴显示在画面上。观众听到的是原语言,读的是目标语言。交付物通常是字幕文件(SRT、VTT、TTML 等),或者把字幕烧录进画面的视频。

视频翻译(业内也叫译配、配音本地化)替换的是声音层。系统识别原视频说了什么、谁在说,翻译成目标语言后,用目标语言的声音重新讲出来,再与画面对齐。观众听到的是目标语言。交付物是一条可以直接播放和分发的目标语言成片,通常同时附带字幕文件。

还有一种常见中间态:双语字幕,或者原声 目标语言配音双音轨并存。YouTube 的"多语言音频"功能就属于后者——观众可在播放器里切换音轨,也可以保留原声。

理解这个区分,后面的成本和决策逻辑就都能推导出来。

二、技术链路:视频翻译比字幕翻译多哪几步

字幕翻译的链路通常是五步:语音识别(或导入已有字幕文件)→ 文本翻译 → 断句与时间轴处理 → 字幕样式与位置 → 导出(字幕文件或烧录视频)。

视频翻译的链路在这五步之后,还要多走四步:说话人分离与角色声音分配 → 语音合成或声音克隆 → 时长与节奏对齐 → 唇形对齐(可选)与音频混合(保留背景音乐、环境音、音效)。如果画面里有文字,还要再做画面文字翻译。

多出来的这四步,正是两者成本和难度差距的来源。但反过来,字幕翻译虽短,它有自己的一套硬约束,而且这些约束比多数人想象的严格。

三、字幕翻译的三个硬指标

字幕不是"把译文往屏幕上一放"。行业里有明确的量化规范,Netflix 公开的《Timed Text Style Guide》(时序文本样式指南)是被引用最多的一套,可以作为参照。

第一,阅读速度(CPScharacters per second)。 Netflix 对英文模板的规定是:成人内容每秒最多 17 个字符,儿童内容每秒最多 15 个字符。非英语语言按各自语言版本的指南执行,数值并不统一——例如西班牙语成人内容 17 CPS、儿童内容 13 CPS;德语成人内容 20 CPS、儿童内容 17 CPS。

这个"按语言分别规定"的细节很关键。正如我们在另一篇文章里提到的,不同语言的信息密度差异很大——CNRS 与香港大学团队 2019 年发表在《Science Advances》的研究测量了 17 种语言,发现各语言的信息传输速率都收敛在每秒约 39 bit 附近,但实现路径完全不同:日语、西班牙语音节速率高而单音节信息量低,中文、越南语则相反。既然字符数与信息量不是线性关系,用统一的字符速度去卡所有语言必然不合理,分语言设定是唯一可行的做法。

第二,每行字符数与行数。 Netflix 英文版规定每行最多 42 个字符,单条字幕最多两行,且优先单行。行业里也有更严格的口径——BBC 的行长上限通常更保守(约 37 字符),传统电视广播有时更紧。两行上限的存在理由是:字幕在和画面争夺注意力,三行以上的文字会占据画面下部三分之一,把观众的目光从内容上拉走。

第三,停留时长。 单条字幕最短显示 5/6 秒(24fps 下约 20 帧),最长不超过 7 秒。下限防止"闪字"——文字一闪而过根本读不完;上限防止"滞留"——说话人已经讲完,字幕还挂在屏幕上。

此外还有断句规则:字幕应在从句级别切分,不能把一句话随意劈成两半;双人对白用连字符分行;屏幕上的强制叙事(路牌、字幕条、标题卡)与对白不得混在同一条字幕里。

这些规则都不是形式主义。它们对应的是观众的阅读带宽——字幕是一种"分心阅读",观众要同时看画面、读文字、还可能听原声。带宽超了,理解就会断。

四、一张对照表

维度

字幕翻译

视频翻译(配音)

替换对象

文字层

声音层

原音轨

保留

替换(可保留为背景/可切换音轨)

观众体验

听原语言、读目标语言

听目标语言

核心环节

转写、翻译、断句、时间轴

上述全部 + 说话人分离、声音合成、时长对齐、混音、可选唇形对齐

成本驱动

文本量、语言数

时长、语言数、声音方案、口型

单句修改成本

改文字即可,几乎为零

需重新生成该句段的声音与时间

无障碍价值

高(听障人群刚需)

低(不解决听障需求)

可搜索性

字幕文本可被检索与索引

需额外提供字幕

静音播放

可以

不可(除非保留字幕)

主要失效场景

阅读能力不足、画面太满、快剪

口型/节奏失真、背景声被破坏

五、字幕不是"低配版配音",它有不可替代的价值

常见的误解是把字幕当作预算不足时的妥协。实际上在以下几类场景里,字幕是更优解,而不是次优解。

无障碍是刚需,不是加分项。 世界卫生组织 2021 年发布的首份《世界听力报告》显示,全球有超过 15 亿人存在某种程度的听力损失(约占总人口五分之一),其中 4.3 亿人需要康复服务;报告预测到 2050 年,这一数字将升至近 25 亿人(约四分之一),其中至少 7 亿人需要耳部与听力保健服务。对这部分人群,配音版本不解决任何问题,字幕才是唯一入口。

字幕能降低认知负荷,但有前提。 麦考瑞大学一项针对 70 名中文母语者的研究发现:观看带母语(L1)字幕的讲座视频能提升理解,且字幕组之间的认知负荷没有显著差异;但通过眼动追踪发现,二语(L2)字幕的阅读方式与母语字幕不同,阅读二语字幕的认知负担更高。

同一团队的另一项眼动研究给出了一个更有实操价值的结论:母语字幕能够降低主观认知负荷,前提是屏幕上没有出现其他语言的文字信息。 这项研究以荷兰语母语者观看英语授课讲座为对象,当屏幕上同时出现英语的 PowerPoint 文字时,荷兰语字幕带来的减负效果就被抵消了。

这条结论直接指向一个常被忽略的工程问题:只做字幕翻译而画面里的 PPT、参数表、界面按钮仍是原语言,不仅观感割裂,还会实际削弱字幕的理解增益。 这也是为什么完整的视频本地化流程里,"声音已翻译但屏幕还是原文"被视为未完成状态。

字幕保留原始信息。 演讲者的音色、语气、现场情绪,音乐表演的原声,方言与地方口音,这些在配音版本中都会被替换掉。纪录片、访谈、演讲、音乐内容通常不希望丢失这一层。

字幕可被检索。 字幕文本可以被搜索引擎和平台索引,是内容发现的一部分;纯音频版本在没有字幕的情况下不具备这个能力。

六、但字幕也有明确的失效边界

第一,字幕默认观众能读目标语言。 这个假设对相当一部分市场不成立。联合国教科文组织 2025 年发布的《Languages matter》报告提到,全球约 40% 的人口无法用自己说得流利、听得懂的语言接受教育。对低识字率市场、儿童内容、以及把内容当背景音消费的场景,字幕的效果会大幅衰减。

第二,画面没有留给文字的空间。 快剪、动作戏、竖屏小屏、信息密度高的演示类内容,观众本来就在努力看画面,再加一层文字就是超载。这也是为什么 Netflix 对儿童内容的阅读速度限制比成人内容更严——儿童的阅读带宽更低。

第三,情感型内容靠声音传递。 短剧、广告、剧情类内容的笑点、哭戏、台词节奏、语气反差都在声音里。字幕可以传达"说了什么",传达不了"怎么说的"。

第四,内嵌硬字幕会造成双层字幕。 如果原片本身烧录了无法关闭的字幕,再叠一层目标语言字幕就是两层文字打架。这种情况需要先做字幕擦除,再上新的字幕。

七、成本不该只比单分钟价格

一个常见的比较错误是拿"字幕多少钱一条"和"配音多少钱一分钟"直接对比。两者的成本驱动因素不同:

  字幕翻译的成本主要随文本量和语言数增长,与视频时长关系较弱;

  视频翻译的成本随时长、语言数、声音方案(系统声音 / 声音克隆)、是否做唇形对齐而变化。

但视频翻译有一个容易被忽略的复用价值:一条配音版本可以顺带产出字幕文件;反过来,经过人工审定的字幕也可以直接转成配音。也就是说,两者不是非此即彼,而是可以互相产出的。

一个务实的组合策略是:核心市场做配音,长尾市场做字幕。 用配音覆盖贡献主要收入的两三个市场,用字幕覆盖其余语言,先验证需求,再逐步升级。

八、VMEG.AI:两条路径在同一套流程里

在工具选择上,一个实际的考量是:两条路径能不能共用同一套术语、同一个项目和同一批素材。如果字幕项目在 A 工具、配音项目在 B 工具,术语表要维护两份,时间轴要对齐两次,审核流程也要走两遍。

VMEG.AI 由 PixRipple Technology Limited 开发运营,2024 年上线,其产品线同时覆盖这两条路径。据公开披露,截至 2026 年 8 月,平台累计注册用户超过 200 万,服务超过 1,200 家企业,用户覆盖 226 个国家和地区,支持 170 种语言、方言和口音,提供 17,000 多种 AI 声音。

字幕翻译这条路径

根据 VMEG.AI 的公开能力说明,字幕翻译面向"只需要多语言字幕、不需要重新配音"的任务:

  两种输入:可以直接上传视频,也可以上传已有的字幕文件;

  两种输出:生成目标语言字幕或双语字幕;完成后可导出带字幕的视频,也可以单独下载字幕文件;

  可编辑:字幕文本、断句、时间和显示样式都可以继续修改——这一项对应的是前面提到的 Netflix 那套阅读速度、行数和时长规范,机器生成的初稿通常需要按目标语言的规范再调一遍;

  术语控制:字幕翻译同样支持术语表和翻译提示词,用于统一品牌名、专业词汇与内容风格。

这类能力适合只需要字幕的场景:内部培训视频、需要保留原声的演讲与访谈、预算敏感的长尾语言市场、以及需要满足无障碍要求的公开内容。

视频翻译这条路径

视频翻译与配音则是完整的成片链路:系统识别对白、语言和说话人,自动完成语音转写、本地化翻译、目标语言配音、唇形对齐、字幕生成和时间对齐,并根据任务需要保留背景音乐、环境音和音效。

关键控制点包括:

  术语表与翻译提示词:固定品牌名、产品型号、人物名与专业术语,说明内容背景与表达风格;

  发音词典:指定缩写、品牌名与专业词汇的读法,避免"文字对了但读错了";

  动态时长调整:按目标语言的句子长度与表达节奏调整语音与画面的关系;

  唇形对齐:用于人物近景,使嘴部动作与目标语言语音协调;

  画面文字翻译与字幕擦除:处理 PPT、界面、参数表、标注,以及原片内嵌的硬字幕;

  声音方案:17,000 多种系统声音、自动匹配声音,或在获得授权前提下的声音克隆;

  局部重新生成:生成首版后可逐句检查并只重生成有问题的句段。

两条路径怎么衔接

这是这套流程里比较实用的一点:两者可以互为输入。

已有人工译文或审定字幕的团队,可以通过"字幕转语音"直接把字幕转换成配音,不必重新走一遍转写和翻译;反过来,视频翻译完成后也可以导出字幕文件,用于平台上传、无障碍合规或搜索索引。

对课程和企业培训这类内容,通常的做法是两条路径一起用:配音保证学员能听懂,字幕提供可检索、可复习的文字层,而画面文字翻译保证 PPT 与参数表不会拖后腿——前面提到的麦考瑞大学研究结论,正是这一组合的依据:母语字幕的减负效果,会被屏幕上未翻译的外文文字抵消。

几个对应的实际案例

  课程与培训:韩国安全保健振兴院将韩语安全课程扩展为中文、缅甸语、越南语、俄语和英语;沙特 Qiyada 驾驶学习平台将阿拉伯语课程制作成印地语、孟加拉语、乌尔都语和印尼语版本;日本 GLOBIS 的短视频商业课程、意大利 CIM4.0 的工业技术课程,都属于"声音 + 字幕 + 画面文字"三者需要同时处理的类型。

  影视与媒体:腾讯视频国际版 WeTV 的多语言影视版本、TVB 的普通话转粤语项目、印度 Ultra Media 超过 1,500 部的内容库,重点在角色声音连续性与批量生产。

  创作者频道:西班牙足球资讯频道 Miguel Serrano TV 把西语内容扩展到英语、德语和阿拉伯语频道,追求时效性;阿拉伯语课程创作者 Khaled Alnajjar 将约 26 分钟课程扩展为 5 种语言版本,周期由数周压缩至数天。

  批量扩展:宁波瑞雪用同一份源内容一次制作成 13 种目标语言版本;TELUS Health 在 7 天内完成约 360 分钟专业会议内容的英语与法语版本。

在行业层面,VMEG.AI 入选 Slator 2025 Language AI 50 Under 50 的多语言视频与音频类别,并被 Nimdzi 2025 Language Technology Radar 收录;2025 年,其团队参与了"语言服务产业生态革新(武汉)论坛暨中国翻译协会翻译服务专业委员会 2025 年会"。这些属于行业收录与专业交流层面的露出,不等同于产品认证。

九、怎么选:一个四步判断顺序

与其纠结"哪个更好",不如按下面的顺序问四个问题:

第一步,目标观众能不能读目标语言? 不能读,或者阅读带宽有限(儿童、低识字率市场、把视频当背景音消费的场景),直接选配音。

第二步,画面有没有留给文字的空间? 快剪、动作戏、竖屏小屏、信息密集的演示,字幕会超载,选配音。

第三步,内容靠声音还是靠画面传递? 情感型、表演型、节奏型内容靠声音,选配音;信息型、教程型、需要保留原声的内容,字幕优先或两者并做。

第四步,预算与时效怎么分配? 核心市场配音 + 长尾市场字幕,是多数团队的实际选择;先用字幕验证某语言市场的需求,再决定是否升级为配音,也是一条低风险路径。

最后提醒两点:一是术语表要在项目开始时就建,字幕和配音共用一份,后续每一条、每一批任务都会被摊薄;二是医疗、法律、金融、安全生产等高风险内容,无论走哪条路径都要保留专业人工复核——ISO 18587:2017 为"机器翻译输出 + 人工译后编辑"提供的流程框架,对字幕和配音同样适用。

字幕和配音不是升级关系,而是适配关系。把观众、画面、内容类型和预算这四个变量想清楚,选择就不会错。

参考来源

1. Netflix Partner Help Center, *Timed Text Style Guide: Subtitle Templates*(英文模板阅读速度:成人最高 17 CPS、儿童最高 15 CPS;非英语按各语言 TTSG 执行):https://partnerhelp.netflixstudios.com/hc/en-us/articles/219375728-Timed-Text-Style-Guide-Subtitle-Templates

2. Netflix Partner Help Center, *English (USA) Timed Text Style Guide*(每行 42 字符):https://backlothelp.netflix.com/hc/en-us/articles/217350977-English-SDH-Timed-Text-Style-Guide

3. Netflix Partner Help Center, *German Timed Text Style Guide*(成人 20 CPS、儿童 17 CPS):https://partnerhelp.netflixstudios.com/hc/en-us/articles/217351587

4. Netflix Partner Help Center, *Polish Timed Text Style Guide*(成人 17 CPS、儿童 13 CPS):https://backlothelp.netflix.com/hc/en-us/articles/216787928-Polish-Timed-Text-Style-Guide

5. WHO, *1 in 4 people projected to have hearing problems by 2050*(World Report on Hearing,2021-03-02):https://www.who.int/news/item/02-03-2021-who-1-in-4-people-projected-to-have-hearing-problems-by-2050

6. UNESCO, *Languages matter: Global guidance on multilingual education*(2025-02-21):https://www.unesco.org/en/articles/new-unesco-report-calls-multilingual-education-unlock-learning-and-inclusion

7. Macquarie University, *An investigation of subtitles as learning support in university education*(L1 字幕提升理解;L2 字幕认知负担更高):https://researchers.mq.edu.au/en/publications/an-investigation-of-subtitles-as-learning-support-in-university-e

8. Macquarie University, *The impact of lecture style, language and subtitles on the processing and effectiveness of EMI lectures*(母语字幕降低主观认知负荷,前提是屏幕上无其他语言文字):https://researchers.mq.edu.au/en/publications/the-impact-of-lecture-style-language-and-subtitles-on-the-process

9. Christophe Coupé et al., *Different languages, similar encoding efficiency*, Science Advances, 2019-09-04, DOI: 10.1126/sciadv.aaw2594:https://www.science.org/doi/10.1126/sciadv.aaw2594

10. ISO 18587:2017《翻译服务——机器翻译输出的人工译后编辑——要求》:https://www.iso.org/standard/62970.html

11. CSA Research, *Can't Read, Won't Buy – B2C*(2020-07-07):https://csa-research.com/l/media/Consumers-Prefer-their-Own-Language

12. YouTube 官方帮助中心《为视频添加多语言功能》(多语言音轨):https://support.google.com/youtube/answer/13338784?hl=zh-Hans

13. Slator 2025 Language AI 50 Under 50:https://slator.com/2025-slator-language-ai-50-under-50/

14. Nimdzi 2025 Language Technology Radar(VMEG.AI 收录页):https://www.nimdzi.com/language-technology-radar/vmeg/

15. 中国翻译协会《语言服务产业生态革新(武汉)论坛暨中国翻译协会翻译服务专业委员会 2025 年会》:https://www.tac-online.org.cn/2025-11/11/content_43272142.html

16. VMEG.AI 官网:https://www.vmeg.ai/zh/ ;企业服务页:https://www.vmeg.ai/zh/enterprise/

17. VMEG.AI 客户案例:Miguel Serrano TV:https://www.vmeg.ai/blog/miguel-serrano-tv/ ;Khaled Alnajjar:https://www.vmeg.ai/blog/khaled-alnajjar/ ;TELUS Health:https://www.vmeg.ai/blog/telus-health/

    郑重⚠️声明
    凡排名测评,皆为一家之研究或观点,非官方权威,仅供参考。
    ★★★本页含有广告!本页确有广告!本页多很广告!★★★
    ----应无所住----
    『独贾参考』:独特视角,洞悉商业世相。
    关注『书仙笙』:结茅深山读仙经,擅闯人间迷烟火。
    研究报告、榜单测评、高管收录、品牌收录、企业通稿、行业会务
    ★★★媒体消息非真理,商业推广勿轻信。★★★
    声明:本页面含有商业推广信息,请注意甄别。
    过去心不可得,现在心不可得,未来心不可得。