返回文章列表
文章阅读约 6 分钟

PDF 翻译完全指南:如何翻译 PDF 又不破坏原来的排版

PDF 翻译为什么总会把格式搞乱,以及 AI 工具如何在保留原有排版、字体和表格的前提下完成翻译。含扫描件 OCR 处理、实用技巧,以及大家最常问的问题解答。

本文要点

  • PDF 记录的是每个字符在页面上的坐标,而不是文档的结构,这就是普通翻译工具会把版面弄乱的根本原因。
  • Doc2Lang 直接在文件内部翻译:每一段译文都会放回它原本所在的文本框,页面不重排、内容不移位。
  • 扫描版 PDF 由内置 OCR 处理,当某一页没有文字层时会自动启用。
  • 每次翻译都会返回三个 PDF:保留原始背景的一份、只有译文的一份,以及原文页与译文页交替排列的双语版。
  • 预览免费、无需注册,看到质量满意后再付费。
免费翻译 PDF

无需注册,预览免费

这种情况你多半遇到过。一份合同、一份年报,或者一本产品手册,需要出一个外语版本。你把它丢进翻译工具,出来的却是一团乱:表格塌了、页眉没了、文字压到图片上面去了。

问题不在你,而在 PDF 这种格式。PDF 是为像素级精确显示而生的,不是为编辑而设计的,所以它只记录每个字符落在页面的哪个位置,而不记录这个字符在文档里扮演什么角色。翻译一份 PDF,从来不是换几个词那么简单,而是一条流水线:先把内容抽出来,再转换语言,最后把页面重新拼回去。

Doc2Lang 翻译后的 PDF,原有排版完整保留

每一次 PDF 翻译都要解决的五个难题

1. 把文字抽出来又不破坏版面

把 PDF 转成可编辑格式,是大多数版面「阵亡」的地方。多栏排版、嵌套表格、浮动图片、内嵌字体,在这个过程中会被打乱顺序甚至直接丢失。一份精心设计的销售提案,到了另一头就成了一整块白底黑字。

2. 扫描页面里根本没有文字

很多 PDF 里没有任何可选中的内容。客户回传的一份已签合同、一张扫描的发票、一页拍照的手册:它们本质上都是图片。在 OCR 把字符识别出来之前,什么都翻译不了,而 OCR 本身也会带来一定的误差。

3. 译文长度会变

各种语言的紧凑程度并不一样。同一段英文原文,译成德语和法语通常会变长,译成日语和中文通常会变短。在一页原本按原文间距调好的版面上,这种长度差异要么撑破文本框,要么留下一块尴尬的空白。

4. 术语在长文档里会漂移

合同里的「不可抗力」、药品申报里的「药代动力学」、财务报表里的「摊余成本」:每一个都必须在第 3 页和第 190 页保持完全一致的译法。在篇幅较长的技术文档里,术语前后不一是最常见的质量问题,也是审校者第一眼就会挑出来的毛病。

5. 交付的文件必须看起来像原件

没人要的是「一份翻译」,大家要的是「一份翻译好的文档」:能发给同一个客户、能印在同样的纸上、能和原件归在一起存档。把词句译对,只完成了一半工作。

AI 如何改变了整个流程

传统做法全靠手工:拿到 PDF,手动转成 Word,翻译,再把格式重新做一遍,最后导回 PDF。一本五十页的技术手册,意味着好几天的工时,账单往往是几千块起步。

大语言模型改变的是这条流水线的中间环节。和逐词硬译的机器翻译不同,像 GPT 这样的模型会先读完一整段再动笔,翻译的是意思,而不是一个个孤立的单词。落到实处,这带来四点好处:

  • 译文自然。 模型理解自己正在翻译的这段话,结果读起来不像机器写的。
  • 几分钟而非几天。 长文档在后台处理,你可以同时忙别的事。
  • 前后一致。 术语和语体从第一页到最后一页保持稳定。
  • 懂结构。 一个懂格式的工具,可以在不拆散文档的前提下完成翻译。

AI 不是万能的。手写体、层层嵌套的复杂版面、高度专业的内容,在正式对外之前仍然值得让人过一遍。但对于普通的商务文档,如今的输出质量已经可以直接交付了。

拿你自己的 PDF 试一试

支持 100 多种语言,预览免费

Doc2Lang 怎样逐一解决这些难题

Doc2Lang 从一开始就是为了保留排版翻译 PDF 而设计的,这决定了每一步的做法。

版面之所以不乱,是因为内容从不重排

这里没有复制粘贴的环节,也没有重做格式的环节。Doc2Lang 会把每一块文字连同它在页面上占据的矩形框一起读取,翻译好之后,再把译文画回同一个矩形框里。因为文字从不被倒进新的文本流,所以两栏的论文仍是两栏,表格单元格里的内容仍留在单元格里。当译文比原文长时,字号会被缩放着塞进框内,而不是任由它把页面的其余部分挤开。

扫描页面自动启用 OCR

你不用做任何预处理,也不用选模式。如果某一页没有文字层,Doc2Lang 会自动切换到扫描件 OCR 翻译,把字符识别出来,并在同一遍处理中翻译好。扫描的合同、拍照的页面、带嵌入文字的图形,原样上传即可。

术语在整篇文档里保持一致

在处理文档的过程中,Doc2Lang 会把遇到的关键术语收集起来并一路沿用,让第一页上的某个术语在最后一页也是同样的译法。你还可以上传自己的术语表,用于品牌名、产品名和内部用词,这些对应关系会在任何出现的地方优先适用。

一次翻译,三个输出版本

每次翻译都会返回三个文件,你需要哪个就下载哪个:

  • 含背景版。 保留原始的图片、背景和版面,只替换其中的文字。这是你发给客户的那一份。
  • 纯文字版。 去掉背景和装饰,只留下干净的译文。适合审校,或者把内容挪到别处再用。
  • 双语版。 原文页和它的译文页在文档中交替出现,原文在前。专为核对译文、校对和语言学习而做。

免费预览,按文档付费

Doc2Lang 会在任何付款之前、无需注册的情况下,先免费翻译文件的一部分,让你用自己的真实内容来判断质量。如果不合适,就调整术语表或翻译风格,再预览一次。没有订阅,也没有每月最低消费。

文件通过 HTTPS 传输,下载完结果后你可以随时把它们从服务器上删除,忘记删的也会在 14 天后自动清除。为翻译提供支持的 OpenAI API 不会保留你的数据,也不会用它训练模型。

让 PDF 翻译效果更好的几个实用技巧

  1. 手头有源文件就传源文件。 如果这份 PDF 是从 Word、PowerPoint 或 InDesign 导出的,请改上传那个原始文件。它带着 PDF 已经丢掉的结构信息,结果会更好。
  2. 在你能掌控的地方尽量简化版面。 层层嵌套的分栏、与图片重叠的文本框,是任何工具(包括本工具)都最难处理的情形。
  3. 动手前先建好术语表。 品牌名、产品名和行业词汇提前定好,是性价比最高的一项质量投入。
  4. 让翻译风格贴合文档类型。 合同和营销手册不该用同一种语体来翻译,Doc2Lang 允许你说明手头是哪一类文档。学术场景下,保留排版的学术论文翻译另有专门的设置。
  5. 预览、调整、再预览。 预览免费,而且你的原件永远不会被改动,所以反复打磨到读着顺为止,没有任何成本。

常见问题

翻译一份 PDF 要多久?
通常几分钟。上传文件后翻译在后台进行,完成时你会收到一封邮件,所以不用一直开着页面等。

能翻译扫描版 PDF 吗?
可以。OCR 已内置在流程中,当某一页没有文字层时会自动启动。扫描的合同和图片型 PDF 无需任何预处理。

翻译后的文件会和原件长得一样吗?
字体、图片、表格和页面版式都会保留,因为译文会放回原来的文本框。在文字长度差异很大的语言之间(比如英译德),个别行可能会排得稍紧一些以便放下。

支持多少种语言?
100 多种,包括中文、英语、日语、韩语、法语、德语、西班牙语、葡萄牙语、意大利语、阿拉伯语、泰语和越南语。OCR 覆盖同样的范围。

我的数据安全吗?
传输通过 HTTPS 加密。你可以在下载后立即删除文件,没删的也会在 14 天后自动清除。你的文档不会被用于训练 AI 模型。

可以一次翻译多个文件吗?
可以。把它们打包成一个 ZIP 压缩包上传即可,Doc2Lang 会自动解压,让你一次上传批量翻译多个文档,并且只为你挑选的那些付费。

从你自己的 PDF 开始

一份客户合同、一篇研究论文、一本产品手册、一份投资者报告。上传它,看看免费预览,再从那里决定下一步。

立即翻译你的 PDF

预览免费,无需注册

分享