AI 生成的译文不断产出,审校人员用放大镜对照原文与译文的示意图

翻译曾经是一件耗时且细致的工作。译者读原文,遇到不明白的地方查资料、上网检索,对照词典斟酌术语,再一句一句把译文写出来。

现在呢?把文章粘贴进生成式 AI 或机器翻译,几秒钟译文就出来了。亲眼见过这种速度,会觉得“已经不需要译者了”“翻译不应该再花什么钱”,其实一点也不奇怪。

AI 确实大幅降低了生成译文所需的时间和成本。想快速了解信息大意、读一封外文邮件、在公司内部分享内容——这类场景下,AI 的译文常常不经人工确认就能直接使用。

但如果译文要作为具备一定质量的成果交付给第三方,情况就不一样了。把译文做出来只是其中一部分;还得有人确认这份译文是否准确传达了原文的内容。

这篇文章就把翻译拆成“生成”和“质量保证”两个部分,来谈谈 AI 改变了什么,又有哪些工作留了下来。

译文质量确实大幅进步

机器翻译的译文比从前自然、易读,这一点应该没有什么争议。

关键的转折点出现在 2016 年前后,神经机器翻译开始普及。Google 在 2016 年发表的神经机器翻译系统(GNMT)论文中提到,在以简单独立句进行的人工评估中,GNMT 的翻译错误比此前基于短语的系统平均少了 60%。

这项评估的条件有限,但足以说明神经机器翻译比上一代系统进步了一大截。不过,它并没有证明机器翻译在所有文档上都能达到与人工翻译相同的水平。

技术的进展也没有停在 2016 年。神经机器翻译持续普及,近年来大语言模型(LLM)也加入了翻译的行列。现在的 AI 可以在短时间内生成语法完整、读起来流畅的译文。

所以,拿过去那种生硬机器译文的印象来评价现在的 AI 翻译,并不公平。本文的前提是:AI 翻译在许多场景下已经非常好用——要问的是,当必须确保“准确性”时,还剩下哪些工作。

“生成”与“质量保证”是两回事

生成译文,指的是读原文、选术语、把译文组织起来。这些工作,AI 大多都加快了。

但只要质量有明确要求,生成的译文就仍然要逐项检查。例如:

  • 原文的信息有没有漏掉?有没有多出原文没有的内容?
  • 修饰关系、因果关系、肯定与否定,有没有变样?
  • 数字、单位、专有名词是否正确?
  • 术语是否符合这个领域、这个语境?
  • 同一个术语、同一种说法,全文是否一致?
  • 译文放到实际用途中,行不行得通?
  • 改了一处,有没有在别处引入新的错误?

我所说的“质量保证成本”,不只是最后跑一遍自动检查工具的费用,还包括对照原文与译文、判断译文是否达到要求所投入的时间、专业知识和确认工夫。

当然,质量保证也有一部分可以自动化。提供术语建议、检索以往译文、协助发现数字不一致或明显的漏译,都是 AI 和计算机辅助翻译(CAT)工具的强项。只是,“生成自动化了”和“质量保证整个都不用做了”,是两件完全不同的事。

译后编辑不是“把译文看一遍”

由人工修改机器翻译或 AI 翻译输出的过程,一般称为译后编辑。

如果工作只是读读译文、改改不通顺的句子和错别字,看起来确实轻松。但要确认译文是否准确对应原文,就必须同时阅读原文和译文。译文读起来再自然,也不代表它准确反映了原文的意思。

做译后编辑的人,得先读懂原文,再判断 AI 是怎么理解的、这个理解站不站得住脚、错了该怎么改。初稿质量好,译后编辑确实可能比从头翻译更快。但实际要花多少时间,取决于原文难度、初稿质量和目标要求——有时候,光是找出错误、把它改对,就要花上不少工夫。

译者检查自己的译文时,原文已经读过、资料已经查过,每个术语怎么选、句子怎么写,都是自己决定的,理由也大致记得。检查当然不能省,但与第一次接触原文和译文相比,负担通常会比较轻。换成第三方审校,就得从头读懂原文和译文——这时的工作内容,其实和译后编辑相差无几。

AI 生成的初稿,对审校的人来说同样是“别人的译文”。除了读原文,还得读 AI 的译文,弄清楚它把原文理解成了什么。和检查自己的译文相比,这就是多出来的一层工作。

人工翻译与 AI/机器翻译流程对比

所以,“译后编辑一定比从头翻译更累”和“有了初稿,工作量一定按比例减少”,这两种说法都过于武断。

关于译后编辑的负担,研究上通常从几个方面来看:工作时间、实际的编辑操作,以及认知负荷——也就是读懂内容、判断对错所耗费的脑力。2025 年发表的一项英译中实验发现,用 GPT-4 辅助的译后编辑,工作时间并没有比传统译后编辑明显缩短,编辑操作方面的负担反而增加,对认知负荷的影响也不一致。

这项实验的参与者是 26 名研究生,结果当然不能直接套用到所有语言、领域和职业译者身上。从这项研究可以看出的,并不是“AI 辅助没有作用”,而是不能简单假设加入 AI 后,工作负担就一定会减轻。

此外,ISO 18587:2017 也对机器翻译输出的完整人工译后编辑流程,以及译后编辑人员应具备的能力,规定了相关要求。在这份标准里,译后编辑是由具备相应能力的人执行的一道正式流程,不是把输出浏览一遍就算完成。

译文再流畅,意思仍可能出错

现在的 AI 翻译,最大的强项就是流畅。但站在质量保证的角度,这个强项是把双刃剑。

生硬的译文,问题自己会浮出来。语法正确、看似合理的译文,反而容易藏住意思上的偏差:原文的某一段悄悄不见了、限制条件的范围变了、多了一层原文没有的因果关系。

术语也是一样。举例来说,trigger the function 如果被译成日文的“機能の発火”(字面近似“功能的点火”),乍看之下可能像是某种专业说法。但实际翻译时,应根据对象和语境考虑“触发该功能”“启动该功能”或“调用该函数”等不同译法。

举这个例子,不是要评判哪一家的 AI。想说的只是:译文流不流畅,和术语、意思恰不恰当,是两个必须分开检查的问题。

用途不同,要求的质量就不同

如果用 AI 翻译只是想了解大意,那么读懂译文的大致内容,目的就达到了。这类场景下,现在的 AI 翻译已经非常好用。

但译文要作为成果交给别人,标准就不一样了。除了好不好读,还要对照原文检查:意思一不一样?术语恰不恰当?文档能不能发挥它应有的作用?万一出错,会不会造成实际的问题?

所以,一个人说“这译文够用了”,另一个人说“这还不能直接交出去”,这两种评价未必相互矛盾,因为双方是依据不同的用途和质量标准作出判断。

围绕 AI 翻译的认知差异,不完全是对 AI 性能的评价不同。“翻译做到什么程度才算完成”,各自的标准不一样,往往才是更大的原因。

定价看总工作量,而不是看“有没有用机器”

机器翻译普及之后,有些译后编辑项目的单价会定得远低于人工翻译,理由是“机器负责翻,人只要看一看”。我自己就见过译后编辑项目的招募信息,开出的单价约为每个日文原文字符 1 日元。

但单看数字,判断不了一个单价是否合理。初稿质量、原文的专业程度、目标质量、出错的后果、交付期限,都会影响实际工作量。如果质量要求不高、初稿又稳定,低单价未必不合理;反过来,如果需要逐项对照原文、还需要专业判断,就算有初稿,工作量也未必省得了多少。

所以,合理的价差不应来自“用了机器就打几折”这种固定折扣,而应来自实际测量:达到所需质量的时间,究竟缩短了多少。真正该看的,不是第一版译文多快出现,而是把译文处理到可以交付,总共花了多少时间。

专利翻译中留下来的确认工作

在专利翻译中,准确反映原文的意思,比译文自然与否更重要。为了准确保留技术内容或权利范围,有时甚至可以接受一定程度的不自然。所以质量保证必须严格确认措辞会如何影响技术内容与权利范围,包括:

  • 权利要求中记载的构成要素,以及相互之间的关系;
  • 单数、复数和选项的处理;
  • 限定性表达有没有多出来或漏掉;
  • 权利要求与说明书的记载是否一致;
  • 与附图标记是否对应;
  • 所选术语在译入语中的含义范围。

即使 AI 缩短了生成初稿的时间,这些确认所需的时间也不一定会按同样的比例缩短。另一方面,核对术语、检索相关文档、比较表达、检查数字和附图标记,这些工作靠 AI 和翻译辅助工具确实能做得更快。

重点不在于“用 AI”还是“不用 AI”的二选一,而在于分清楚:哪些环节可以自动化,哪些环节仍然要靠人来判断。

降下来的,不是翻译的全部成本

AI 大幅降低了生成译文的成本。在某些用途下,几乎立刻就能获得可直接派上用场的译文。这是翻译技术的明确进步。

但只要准确性、专业性、一致性或法律效力需要有保证,生成的译文就仍然要经过验证。这些工作同样能靠 AI 提升效率,只是质量保证成本不会自动跟着生成成本以同样的比例下降。

评估 AI 带来的效益时,不要只看译文出现得多快,还要看达到所需质量总共投入了多少时间和工夫。

“编辑距离”是衡量文本改动幅度的指标,但它不等于总工作量。就算译文几乎不用改,“确认它是对的”本身也要花时间。所以,评估 AI 带来的效益时,除了实际的修改量,也要把确认所花的时间算进去。

把这两种成本分开来看,我们就更容易跳出“AI 让翻译近乎免费”和“专业翻译不能用 AI”这两种极端说法,按照用途、质量和风险,作出更贴近实际的判断。

参考资料