PDF 保留版式翻译工具
翻译 PDF 文本并按原文本框位置覆盖回页面,生成保留结构的中文版产物。
- 本人职责
- 一次性翻译缓存与版式回填脚本
- 时间范围
- 2026-07
- 技术栈
- Python / PyMuPDF / 翻译缓存 / 文本框回填
- 最后核验
- 2026/07/17
01 / Problem
问题背景
普通 PDF 翻译容易丢失原页面结构,长文档重复请求又会浪费已完成的翻译结果。
02 / Approach
方法与结构
- 提取每页文字块和边界框,并为技术术语设置保护规则。
- 使用翻译缓存减少重复请求。
- 清除原文字块后按原边界框回填中文,并逐步缩小字体以适应版面。
03 / Decisions
核心决策与取舍
- 首版绑定单一输入文件,诚实标记为一次性交付物。
- 脚本调用第三方翻译接口,因此不宣称离线或适合敏感文档。
- 不公开受版权保护的原文页面、全文译文和缓存内容。
04 / Outcome
结果与当前边界
- 生成 159 页 A4 中文版 PDF 产物。
- 脚本具备翻译缓存、术语保护和文本框覆盖式排版。
- 产品化仍需要参数化输入、通用字体策略和可授权样例。
05 / Evidence
可查看证据
只有重新执行或重新检查过的事实才进入这里;没有公开链接的项目只显示来源核验摘要。
159 页 A4 产物
使用 PDF 元数据工具核验现有中文版产物的页数和页面尺寸。
缓存与文本框回填
源码包含缓存读写、边界框提取、遮盖和 insert_textbox 回填流程。