本地自动化工具一次性交付物已形成产物

PDF 保留版式翻译工具

翻译 PDF 文本并按原文本框位置覆盖回页面,生成保留结构的中文版产物。

本人职责
一次性翻译缓存与版式回填脚本
时间范围
2026-07
技术栈
Python / PyMuPDF / 翻译缓存 / 文本框回填
最后核验
2026/07/17

01 / Problem

问题背景

普通 PDF 翻译容易丢失原页面结构,长文档重复请求又会浪费已完成的翻译结果。

02 / Approach

方法与结构

  • 提取每页文字块和边界框,并为技术术语设置保护规则。
  • 使用翻译缓存减少重复请求。
  • 清除原文字块后按原边界框回填中文,并逐步缩小字体以适应版面。

03 / Decisions

核心决策与取舍

  1. 首版绑定单一输入文件,诚实标记为一次性交付物。
  2. 脚本调用第三方翻译接口,因此不宣称离线或适合敏感文档。
  3. 不公开受版权保护的原文页面、全文译文和缓存内容。

04 / Outcome

结果与当前边界

  • 生成 159 页 A4 中文版 PDF 产物。
  • 脚本具备翻译缓存、术语保护和文本框覆盖式排版。
  • 产品化仍需要参数化输入、通用字体策略和可授权样例。

05 / Evidence

可查看证据

只有重新执行或重新检查过的事实才进入这里;没有公开链接的项目只显示来源核验摘要。

报告

159 页 A4 产物

使用 PDF 元数据工具核验现有中文版产物的页数和页面尺寸。

来源核验

缓存与文本框回填

源码包含缓存读写、边界框提取、遮盖和 insert_textbox 回填流程。

返回项目与建设路线