“这篇 75 页的报告明天组会要讲,能不能给我一份中文版——公式别乱,图别丢,页码还能对上原文?”
SuperTranslate · 像素级保真的 Agent-Native 论文翻译引擎
市面上的工具会先把 PDF 拆开重排:正文是翻出来了,公式挤成一行、双栏变成单栏、图注对不上号。SuperTranslate 走了另一条路——不重排。原文哪一块在哪,译文就在哪:公式、图表、版式,一个像素不动。
对象冻结 + 原位回填 + 确定性 QA 循环 = 一份敢逐页对照检查的译文
75 页 Cosmos 实测 75/75 页 · 0 缺陷·1,066 条术语库·1855 个测试·数据全程留在本地
EN 原文
ZH 译文
全部取自真实翻译产物的原样渲染,未做修饰:左侧原文、右侧译文,分割线随你拖动。 四篇展示论文(DPO、Mistral 7B、Qwen-RobotWorld、Cosmos)均为 CC BY 4.0 许可。






公式、结构图、双栏首屏——版式最容易翻坏的地方,原文与译文并排对照(240 DPI 渲染)。
遵守论文许可:仅 CC BY 4.0 论文(DPO、Mistral 7B、Qwen-RobotWorld、Cosmos)公开展示完整翻译页; arXiv 非独占许可论文(Attention、ResNet)只展示小幅局部对比与聚合指标。
DPO(27 页 · CC BY 4.0)同一页原文(第 4 页:小节标题 + 加粗导语 + 公式 (4)–(7)),三条路各走一遍: 把整页文本直接贴给大模型(deepseek-v4-pro,与我们同一后端)、交给 pdf2zh(v1.9.11,默认 Google 翻译后端,同机实测)、 交给 SuperTranslate(DeepSeek 后端)。四列点击可看原图。
怎么读这四列:直接丢给大模型——同一个模型译文本身不差,公式 (4)(5) 也还能渲染,但从 (6) 起模型自己写的 LaTeX 退化成源码、下划线触发整段误斜体,且产物只是一段聊天文本,双栏、页码、引用锚点全部消失; pdf2zh——保住了「像一页论文」,但整页重排:加粗导语丢失、引用链接框漂移; SuperTranslate——公式冻结不经过模型,正文按原坐标回填,与原文逐像素对应。
换一种版式类型再走一遍:这篇几乎没有公式,难点是模型名与机构名、密集的结果表、加粗导语列表和整整两页参考文献。整页对比已加入上方滑块(Mistral 7B 标签)。
table_cells_reflowed 与 text_outside_frame(旧产物报警、新产物安静)。修复带单测,live 重跑 inspect 0 issue —— issue #2。1,066 条学术语料逐块注入提示词,「Abstract→摘要」「preference→偏好」全文一致,不靠单次运气(细节①)。
粗体导语、小节标题、hyperref 链接框都在原位;重排式工具最常丢的就是这些(细节②)。
对象级 QA 统计每块中文覆盖率,定义/引理这类整段漏翻直接判缺陷、带清单重译(细节③)。
导师说「看第 4 页式 (5)」,中英两版位置相同——重排式译文做不到与原文互相定位(滑块对比)。
每份产物附 QA 报告与 inspect 审计,未过检进入只接受严格变好的修复循环;实测暴露的 QA 盲区当天变成新检测器(机制)。
双语对照阅读器、Agent Skill、断点续跑的批处理——是一套读论文的工作流,不是一次性转换(两种形态)。
口径说明:「直接丢给大模型」列为同一后端(deepseek-v4-pro)对整页 pdftotext 文本的单轮翻译,输出按聊天界面的真实能力呈现(markdown + KaTeX 渲染,渲染失败处即模型自身输出的 LaTeX 缺陷); pdf2zh 是同类开源方案中的优秀代表,其默认后端为逐句机器翻译,本对比聚焦版式与结构保真而非译文文采; SuperTranslate 产物均为单遍翻译 + inspect 审计:DPO 展示页 0 缺陷(全篇 3 处报告集中在附录样例框);Mistral 7B 首次实测 inspect 报 0 issue 却漏掉了表 4 与提示框两处真实缺陷,这次实测直接换来了四个引擎修复和两个新检测器,展示图已更新为修复后的 live 重跑产物(inspect 0 issue,且新检测器在旧产物上能报警)。 引擎来源:DPO 这组图由当时开发中的引擎工作区产出,用仓库已发布引擎重翻替换已排队(等 API 额度);Mistral 7B 一组完全由已发布引擎产出,可直接复现。 三侧完整命令、提示词、版本与环境记录于 NOTES.md,欢迎复现。
各方式定位并不相同:硬读原文最忠实但最慢;聊天粘贴最轻但丢版式;重排式工具翻得快但版面失真。SuperTranslate 补的是它们之间缺失的一层——译文与原文逐像素可对照、质量可自证。此表为定位对照而非优劣评判,别家能力描述基于公开文档(2026-08 查阅)。
| 能力 | 硬读英文原文 | GPT / Kimi 粘贴 | Google 文档翻译 | 沉浸式翻译 | pdf2zh | SuperTranslate |
|---|---|---|---|---|---|---|
| 中文母语阅读速度 | — | ✓ | ✓ | ✓ | ✓ | ✓ 纯中文 / 双语 PDF |
| 版式保持 | ✓ 原文即版式 | — | ◐ 近似¹ | ◐ 对照式¹ | ◐ 重排实现¹ | ✓ 逐像素一致 |
| 独立公式完整 | ✓ | — 易乱码 | —¹ | ◐¹ | ◐ 声明保留¹ | ✓ 冻结不经模型 |
| 行内公式嵌中文句 | n/a | — | — | ◐¹ | ◐¹ | ✓ 断行后仍原样 |
| 图表与图注 | ✓ | — | ◐ 图不翻¹ | ◐¹ | ◐¹ | ✓ 图文保护+图注翻译 |
| 长文档(75 页级) | ✓ 但最耗时 | — 上下文受限 | ◐ 大小限制¹ | ◐¹ | ◐¹ | ✓ 75/75 页实测 |
| 术语一致性 | ◐ 取决于读者 | — 漂移 | — | — | — | ✓ 1,066 条语料+可扩展 |
| 双栏对照阅读器 | — | — | — | ◐ 网页交错 | ◐ 双语 PDF¹ | ✓ 同步滚动 |
| 译后 QA 审计 | n/a | — | — | — | —¹ | ✓ 对象级+严格变好循环 |
| Agent 一句话集成 | — | ◐ 无版式 | — | — | — | ✓ Claude Code / Cursor Skill |
| 批量处理 | — | — | — | ◐¹ | ✓ CLI¹ | ✓ 并行+治理型批处理 |
| 本地部署 · 数据不出机 | ✓ | — 云 | — 云 | ◐ 扩展+云¹ | ✓¹ | ✓ Docker / uv 自托管 |
| 开源可审计 | n/a | — | — | ◐ 本体闭源¹ | ✓ AGPL¹ | ✓ AGPL + QA 证据公开 |
✓ 具备 · ◐ 部分具备/视情况 · — 不提供 · ¹ 基于各工具公开文档(2026-08 查阅),欢迎指正;「GPT / Kimi 粘贴」与 pdf2zh 两列已补同机实测图像对比(DPO、Mistral 7B 两篇),见「横向实测」。
结构先冻结、术语库逐块注入、正文才翻译;QA 未过检就进入 Agentic 修复循环, 只接受严格变好,否则回滚——版式「一个像素不动」靠的不是运气,是这三张图里的设计。
想要一张图看完整技术细节?完整单图版 ↗,代码级讲解见 MECHANISM.md。
条精编术语 · 23 个分类 · 3 份语料
专为学术翻译设计:翻译每个文本块时按相关性检索术语注入提示词(不整库硬塞);
专有名词首现写作「中文术语(English Term)」、之后只用中文;
CI 以 corpus-lint --strict 做跨领域一致性门禁,译后再审计术语采用率。
而且随你扩展:一条 corpus-add 命令加词;或把自己领域的词表 JSON 丢进
corpora/ 目录即自动加载,同名条目以你的为准;翻译中收集的术语候选还有
review → audit → promote 流水线批量入库——改完 corpus-lint --strict 把关即生效。
从版式引擎到 QA 审计,从 Web 工作台到 Agent Skill——同一套引擎,覆盖个人精读与课题组批量两种节奏。
原页尺寸、图片、矢量图形与文本块坐标全部保留,译文原位回填;CJK 字体子集嵌入,产物紧凑。
漏翻、保护区改动、版面重叠 / 空页 / 图片丢失、术语一致性逐对象检查,输出机读 *.qa.json;质量环仅在错误分严格下降时替换产物。
DeepSeek、Kimi K3、OpenAI、Claude、GLM、Google 随时切换;per-user API key AES-GCM 加密存储,不进日志不回传。
原文 / 译文左右同步滚动,分割线可拖;纯中文 _zh.pdf 与双语 _dual.pdf 都能下载。
多篇队列、任务崩溃后自动恢复、翻译缓存复用——重试不重复消耗 API 额度;大文件分块续传。
在 Claude Code / Cursor 里直接说「把这篇翻成中文」,Skill 按 SOP 跑完翻译 + QA 全流程,达标才交付。
自托管 FastAPI + SQLite,论文与 API key 不经第三方;AGPL-3.0 开源,网络服务须向用户开放源码。
75 页 Cosmos 技术报告全篇翻译,QA 75/75 页零问题;30 分钟级长任务可排队、可取消、可恢复。
Web 部署给课题组共用,Agent Skill 给生活在 AI 编辑器里的你——底层同一套翻译引擎与 QA 体系。
适合 实验室 / 课题组共用一台服务器,手机平板也能读
适合 重度 agent 用户、批量翻译与可复现实验场景
以下全部为真实运行截图(本机离线复现,未做修饰); 演示动图是「上传 → 翻译 → 双栏阅读」的完整流程。
本地部署:论文、译文与 API key 都留在你的服务器上,key 加密存进本机 SQLite,界面只显示尾号。
事实纪律:以上数字对应仓库内基准清单、QA 报告与测试套件,均可复核;「75/75 · 0 issue」指 75 页《Cosmos World Foundation Model Platform》全篇翻译的正式 QA 结果。
部署成课题组网站,或装进你的 AI 编辑器——选一条开始。
git clone https://github.com/asimfish/super_translate.git
cd super_translate
cp .env.example .env # 填入 LLM API key 与访问令牌
docker compose up -d --build
打开 https://你的域名(或本机端口)即可上传第一篇论文。VPS + 自动 HTTPS、备份与排障见 部署指南; 不想用 Docker 也可以 pip install -e . 后用 uvicorn 起本机服务,见 中文教程。
git clone https://github.com/asimfish/super_translate.git
# Claude Code(全局技能目录)
mkdir -p ~/.claude/skills
ln -s "$PWD/super_translate/skills/paper-translate" ~/.claude/skills/paper-translate
# Cursor:改为链接到你项目内的 .cursor/skills/ 目录
然后在对话里直接说:「把 paper.pdf 翻译成中文,保留原版式」。 Skill 会按 SKILL.md 的 SOP 完成术语预检、翻译与 QA 审计,达标才算完成。