PDF 翻译完全指南:如何翻译 PDF 又不破坏原来的排版
PDF 翻译为什么总会把格式搞乱,以及 AI 工具如何在保留原有排版、字体和表格的前提下完成翻译。含扫描件 OCR 处理、实用技巧,以及大家最常问的问题解答。
本文要点
- PDF 记录的是每个字符在页面上的坐标,而不是文档的结构,这就是普通翻译工具会把版面弄乱的根本原因。
- Doc2Lang 直接在文件内部翻译:每一段译文都会放回它原本所在的文本框,页面不重排、内容不移位。
- 扫描版 PDF 由内置 OCR 处理,当某一页没有文字层时会自动启用。
- 每次翻译都会返回三个 PDF:保留原始背景的一份、只有译文的一份,以及原文页与译文页交替排列的双语版。
- 预览免费、无需注册,看到质量满意后再付费。
无需注册,预览免费
这种情况你多半遇到过。一份合同、一份年报,或者一本产品手册,需要出一个外语版本。你把它丢进翻译工具,出来的却是一团乱:表格塌了、页眉没了、文字压到图片上面去了。
问题不在你,而在 PDF 这种格式。PDF 是为像素级精确显示而生的,不是为编辑而设计的,所以它只记录每个字符落在页面的哪个位置,而不记录这个字符在文档里扮演什么角色。翻译一份 PDF,从来不是换几个词那么简单,而是一条流水线:先把内容抽出来,再转换语言,最后把页面重新拼回去。
每一次 PDF 翻译都要解决的五个难题
1. 把文字抽出来又不破坏版面
把 PDF 转成可编辑格式,是大多数版面「阵亡」的地方。多栏排版、嵌套表格、浮动图片、内嵌字体,在这个过程中会被打乱顺序甚至直接丢失。一份精心设计的销售提案,到了另一头就成了一整块白底黑字。
2. 扫描页面里根本没有文字
很多 PDF 里没有任何可选中的内容。客户回传的一份已签合同、一张扫描的发票、一页拍照的手册:它们本质上都是图片。在 OCR 把字符识别出来之前,什么都翻译不了,而 OCR 本身也会带来一定的误差。
3. 译文长度会变
各种语言的紧凑程度并不一样。同一段英文原文,译成德语和法语通常会变长,译成日语和中文通常会变短。在一页原本按原文间距调好的版面上,这种长度差异要么撑破文本框,要么留下一块尴尬的空白。
4. 术语在长文档里会漂移
合同里的「不可抗力」、药品申报里的「药代动力学」、财务报表里的「摊余成本」:每一个都必须在第 3 页和第 190 页保持完全一致的译法。在篇幅较长的技术文档里,术语前后不一是最常见的质量问题,也是审校者第一眼就会挑出来的毛病。
5. 交付的文件必须看起来像原件
没人要的是「一份翻译」,大家要的是「一份翻译好的文档」:能发给同一个客户、能印在同样的纸上、能和原件归在一起存档。把词句译对,只完成了一半工作。
AI 如何改变了整个流程
传统做法全靠手工:拿到 PDF,手动转成 Word,翻译,再把格式重新做一遍,最后导回 PDF。一本五十页的技术手册,意味着好几天的工时,账单往往是几千块起步。
大语言模型改变的是这条流水线的中间环节。和逐词硬译的机器翻译不同,像 GPT 这样的模型会先读完一整段再动笔,翻译的是意思,而不是一个个孤立的单词。落到实处,这带来四点好处:
- 译文自然。 模型理解自己正在翻译的这段话,结果读起来不像机器写的。
- 几分钟而非几天。 长文档在后台处理,你可以同时忙别的事。
- 前后一致。 术语和语体从第一页到最后一页保持稳定。
- 懂结构。 一个懂格式的工具,可以在不拆散文档的前提下完成翻译。
AI 不是万能的。手写体、层层嵌套的复杂版面、高度专业的内容,在正式对外之前仍然值得让人过一遍。但对于普通的商务文档,如今的输出质量已经可以直接交付了。
支持 100 多种语言,预览免费
Doc2Lang 怎样逐一解决这些难题
Doc2Lang 从一开始就是为了保留排版翻译 PDF 而设计的,这决定了每一步的做法。
版面之所以不乱,是因为内容从不重排
这里没有复制粘贴的环节,也没有重做格式的环节。Doc2Lang 会把每一块文字连同它在页面上占据的矩形框一起读取,翻译好之后,再把译文画回同一个矩形框里。因为文字从不被倒进新的文本流,所以两栏的论文仍是两栏,表格单元格里的内容仍留在单元格里。当译文比原文长时,字号会被缩放着塞进框内,而不是任由它把页面的其余部分挤开。
扫描页面自动启用 OCR
你不用做任何预处理,也不用选模式。如果某一页没有文字层,Doc2Lang 会自动切换到扫描件 OCR 翻译,把字符识别出来,并在同一遍处理中翻译好。扫描的合同、拍照的页面、带嵌入文字的图形,原样上传即可。
术语在整篇文档里保持一致
在处理文档的过程中,Doc2Lang 会把遇到的关键术语收集起来并一路沿用,让第一页上的某个术语在最后一页也是同样的译法。你还可以上传自己的术语表,用于品牌名、产品名和内部用词,这些对应关系会在任何出现的地方优先适用。
一次翻译,三个输出版本
每次翻译都会返回三个文件,你需要哪个就下载哪个:
- 含背景版。 保留原始的图片、背景和版面,只替换其中的文字。这是你发给客户的那一份。
- 纯文字版。 去掉背景和装饰,只留下干净的译文。适合审校,或者把内容挪到别处再用。
- 双语版。 原文页和它的译文页在文档中交替出现,原文在前。专为核对译文、校对和语言学习而做。
免费预览,按文档付费
Doc2Lang 会在任何付款之前、无需注册的情况下,先免费翻译文件的一部分,让你用自己的真实内容来判断质量。如果不合适,就调整术语表或翻译风格,再预览一次。没有订阅,也没有每月最低消费。
文件通过 HTTPS 传输,下载完结果后你可以随时把它们从服务器上删除,忘记删的也会在 14 天后自动清除。为翻译提供支持的 OpenAI API 不会保留你的数据,也不会用它训练模型。
让 PDF 翻译效果更好的几个实用技巧
- 手头有源文件就传源文件。 如果这份 PDF 是从 Word、PowerPoint 或 InDesign 导出的,请改上传那个原始文件。它带着 PDF 已经丢掉的结构信息,结果会更好。
- 在你能掌控的地方尽量简化版面。 层层嵌套的分栏、与图片重叠的文本框,是任何工具(包括本工具)都最难处理的情形。
- 动手前先建好术语表。 品牌名、产品名和行业词汇提前定好,是性价比最高的一项质量投入。
- 让翻译风格贴合文档类型。 合同和营销手册不该用同一种语体来翻译,Doc2Lang 允许你说明手头是哪一类文档。学术场景下,保留排版的学术论文翻译另有专门的设置。
- 预览、调整、再预览。 预览免费,而且你的原件永远不会被改动,所以反复打磨到读着顺为止,没有任何成本。
常见问题
翻译一份 PDF 要多久?
通常几分钟。上传文件后翻译在后台进行,完成时你会收到一封邮件,所以不用一直开着页面等。
能翻译扫描版 PDF 吗?
可以。OCR 已内置在流程中,当某一页没有文字层时会自动启动。扫描的合同和图片型 PDF 无需任何预处理。
翻译后的文件会和原件长得一样吗?
字体、图片、表格和页面版式都会保留,因为译文会放回原来的文本框。在文字长度差异很大的语言之间(比如英译德),个别行可能会排得稍紧一些以便放下。
支持多少种语言?
100 多种,包括中文、英语、日语、韩语、法语、德语、西班牙语、葡萄牙语、意大利语、阿拉伯语、泰语和越南语。OCR 覆盖同样的范围。
我的数据安全吗?
传输通过 HTTPS 加密。你可以在下载后立即删除文件,没删的也会在 14 天后自动清除。你的文档不会被用于训练 AI 模型。
可以一次翻译多个文件吗?
可以。把它们打包成一个 ZIP 压缩包上传即可,Doc2Lang 会自动解压,让你一次上传批量翻译多个文档,并且只为你挑选的那些付费。
从你自己的 PDF 开始
一份客户合同、一篇研究论文、一本产品手册、一份投资者报告。上传它,看看免费预览,再从那里决定下一步。
预览免费,无需注册