SUPERTRANSLATE保版式论文翻译 · EN → ZH
Open Source · AGPL-3.0 · Web 应用 + Agent Skill

速刷论文,却卡在英文阅读上?

一个再普通不过的需求 · 一位深夜还在读论文的研究生

“这篇 75 页的报告明天组会要讲,能不能给我一份中文版——公式别乱,图别丢,页码还能对上原文?”

SuperTranslate · 像素级保真的 Agent-Native 论文翻译引擎

市面上的工具会先把 PDF 拆开重排:正文是翻出来了,公式挤成一行、双栏变成单栏、图注对不上号。SuperTranslate 走了另一条路——不重排。原文哪一块在哪,译文就在哪:公式、图表、版式,一个像素不动

  • 公式、图表、引用先冻结,一个字符都不交给模型
  • 译文按原坐标回填,页面几何和原文完全一致
  • 每页都过 QA 审计,修复只有严格变好才被接受

对象冻结 + 原位回填 + 确定性 QA 循环 = 一份敢逐页对照检查的译文

75 页 Cosmos 实测 75/75 页 · 0 缺陷·1,066 条术语库·1855 个测试·数据全程留在本地

localhost:8001 · cosmos_zh.pdf LIVE
Cosmos 第 1 页译文 Cosmos 第 1 页原文 EN 原文 ZH 译文
Cosmos World Foundation Model Platform · 第 1 页整页渲染,自动扫视 拖动对比 ↓
Evidence · 效果对比

拖动分割线,逐像素检查

全部取自真实翻译产物的原样渲染,未做修饰:左侧原文、右侧译文,分割线随你拖动。 四篇展示论文(DPO、Mistral 7B、Qwen-RobotWorld、Cosmos)均为 CC BY 4.0 许可。

页码

切片速览 · 标题与公式
论文大标题cosmos · p1 · 品牌绿原样
ENCosmos 论文标题原文
ZHCosmos 论文标题译文,品牌色与字重保持
小节标题attention · p4 · 编号粗体保真
ENAttention 3.2.2 小节标题原文
ZHAttention 3.2.2 小节标题译文,编号与粗体保持
独立公式attention · p4 · 两行零差异
ENAttention 公式 (1) 原文
ZHAttention 公式 (1) 译文,与原文逐像素一致
译文页
原文页
EN 原文 ZH 译文
Zoom In · 局部放大对比

经典论文,只看最难的细节

公式、结构图、双栏首屏——版式最容易翻坏的地方,原文与译文并排对照(240 DPI 渲染)。

Attention Is All You Need · 独立公式:正文照译,公式冻结attention · p4 · 240dpi
EN 原文 Attention 公式 (1) 上下文原文
ZH 译文 Attention 公式 (1) 上下文译文
上下两条对照:段落译成了中文,公式 (1) 与编号一个像素没动 · 全篇 15 页:0 error · visual 0.9041 · 严格门禁通过
DDPM · 行内公式:数学嵌在中文句子里ddpm · p2 · 240dpi · 难度更高
EN 原文 DDPM 行内公式段落原文
ZH 译文 DDPM 行内公式段落译文
行内数学比独立公式更难:pθ(x0)、x0∼q(x0) 要嵌进重新断行的中文句子里,还得与引用标注 [53] 一起原样保留
Attention · 结构图attention · p4
EN 原文 Attention 图 2 原文
ZH 译文 Attention 图 2 译文
图 2 结构图:图内冻结,图注翻译位置不动
ResNet · 双栏首屏resnet · p1
EN 原文 ResNet 双栏首屏原文
ZH 译文 ResNet 双栏首屏译文
CVPR 双栏:栏宽与图 1 原位 · 12 页:0 error · visual 0.8621
Cosmos · 长文深处cosmos · p34 图 17
EN 原文 Cosmos 图 17 原文
ZH 译文 Cosmos 图 17 译文
75 页第 34 页:帧网格 + Prompt 翻译 · 后段不衰减

遵守论文许可:仅 CC BY 4.0 论文(DPO、Mistral 7B、Qwen-RobotWorld、Cosmos)公开展示完整翻译页; arXiv 非独占许可论文(Attention、ResNet)只展示小幅局部对比与聚合指标。

Head-to-Head · 横向实测

同一篇论文,交给别的工具会怎样

DPO(27 页 · CC BY 4.0)同一页原文(第 4 页:小节标题 + 加粗导语 + 公式 (4)–(7)),三条路各走一遍: 把整页文本直接贴给大模型(deepseek-v4-pro,与我们同一后端)、交给 pdf2zh(v1.9.11,默认 Google 翻译后端,同机实测)、 交给 SuperTranslate(DeepSeek 后端)。四列点击可看原图。

原文dpo · p4
DPO 第 4 页原文:小节标题、加粗导语与公式 (4)-(7)
直接丢给大模型deepseek · 纯文本
同一页文本直接交给 DeepSeek 翻译:正文可读但版式全无,公式 (6) 起退化为 LaTeX 源码
pdf2zhv1.9.11 · google 后端
DPO 第 4 页 pdf2zh 译文:加粗导语丢失、引用链接框漂移
SuperTranslatedeepseek 后端
DPO 第 4 页 SuperTranslate 译文:公式冻结、粗体与标题字重保真

怎么读这四列:直接丢给大模型——同一个模型译文本身不差,公式 (4)(5) 也还能渲染,但从 (6) 起模型自己写的 LaTeX 退化成源码、下划线触发整段误斜体,且产物只是一段聊天文本,双栏、页码、引用锚点全部消失; pdf2zh——保住了「像一页论文」,但整页重排:加粗导语丢失、引用链接框漂移; SuperTranslate——公式冻结不经过模型,正文按原坐标回填,与原文逐像素对应。

细节 ① 摘要标题:术语库的价值dpo · p1 · 240dpi
EN 原文 DPO 摘要标题原文 Abstract
PDF2ZH pdf2zh 将 Abstract 译为「抽象的」且丢失粗体
ZH 译文 SuperTranslate 译为「摘要」并保持标题字重
「Abstract」被逐词直译成「抽象的」且丢了标题粗体;术语库给出学术惯用的「摘要」,标题字重保留。
细节 ② 加粗导语与交叉引用dpo · p4 · 240dpi
EN 原文 DPO 原文加粗导语 Deriving the DPO objective 与引用链接
PDF2ZH pdf2zh 导语粗体丢失、引用链接框脱离文字漂浮
ZH 译文 SuperTranslate 导语粗体保真、引用原位嵌入中文句
pdf2zh:导语粗体丢失,Eq. 3 与引用的链接框脱离文字漂浮成空框;SuperTranslate:「推导直接偏好优化目标。」粗体保真,[31,30,19,15] 与式 3 原位嵌入重新断行的中文句。
细节 ③ 定义与引理:漏翻检测dpo · p5 · 240dpi
EN 原文 DPO 第 5 页原文:Definition 1 与 Lemma 1/2,斜体定理体例
PDF2ZH pdf2zh 输出:定义 1 与引理 1/2 的正文整段保留英文未翻译
ZH 译文 SuperTranslate 输出:定义与引理全部译为中文,编号粗体与行内数学保留
定理体例的斜体段最容易被整段跳过:pdf2zh 把定义 1、引理 1、引理 2 的正文原封不动留成英文(编号却翻了);SuperTranslate 全部译出,「定义 1。」「引理 1。」粗体保留,r(x,y)−r′(x,y)=f(x) 等行内数学原样。我们的 QA 会按块统计中文覆盖率,漏翻会被当作缺陷打回重译——这类整段漏翻过不了检。
第二篇 · Mistral 7B 9 页 · arXiv 2310.06825 · CC BY 4.0 · pdf2zh v1.9.11 同机实测 · SuperTranslate 单遍翻译(修复后 live 重跑)· inspect 0 issue

换一种版式类型再走一遍:这篇几乎没有公式,难点是模型名与机构名、密集的结果表、加粗导语列表和整整两页参考文献。整页对比已加入上方滑块(Mistral 7B 标签)。

细节 ④ 标题与作者栏:专名不音译mistral · p1 · 240dpi
EN 原文 Mistral 7B 标题页原文:标题与加粗作者栏
PDF2ZH pdf2zh 把标题 Mistral 7B 音译为「米斯特拉尔7B」,作者栏丢粗体、人名被从中间断行
ZH 译文 SuperTranslate 保留标题 Mistral 7B 原名,作者栏粗体与居中排版原样
pdf2zh 把模型名「Mistral 7B」音译成「米斯特拉尔7B」,作者栏丢失粗体、人名从单词中间断行(De/vendra、G/uillaume)、分隔符变成中文顿号;SuperTranslate 术语库把模型名、机构名、基准名列为不译项,标题原名保留、作者栏粗体居中原样
细节 ⑤ 参考文献:保持可检索mistral · p8 · 240dpi
EN 原文 Mistral 7B 参考文献原文:编号悬挂缩进的条目
PDF2ZH pdf2zh 把参考文献标题译成中文、条目合并成一段、人名被改写
ZH 译文 SuperTranslate 只译「参考文献」标题,每条文献原文原样、悬挂缩进保留
pdf2zh 把每条文献的论文标题译成中文、整节合并成一段、人名被改写(Jianfeng Gao → Jianfeng Taka)——译完就搜不到原文了;SuperTranslate 只译节标题「参考文献」,条目逐字原样、编号悬挂缩进保留,随手复制标题即可检索。
我们输过的一处 · 首次实测暴露,随即修复mistral · p5 · 240dpi · issue #2 已关闭
EN 原文 Mistral 7B 第 5 页原文:系统提示框与无框线的表 4
PDF2ZH pdf2zh 保留了表 4 的表格结构与粗体表头
ZH 修复前 修复前:SuperTranslate 把无框线的表 4 当成正文重排,系统提示框文字超出右边框
ZH 修复后 修复后:表 4 表头粗体与单元格对齐原样保留,提示框译文完全在框内
首次实测:无框线小表被当正文重排、提示框译文越出右边框,inspect 全程沉默——pdf2zh 此处是对的。我们先把输掉的图原样发出,再修根因:表格判据加入「列边严格对齐 + 数值列」几何证据回填以矢量框线为硬边界,QA 新增 table_cells_reflowedtext_outside_frame(旧产物报警、新产物安静)。修复带单测,live 重跑 inspect 0 issue —— issue #2
术语成体系

1,066 条学术语料逐块注入提示词,「Abstract→摘要」「preference→偏好」全文一致,不靠单次运气(细节①)。

结构字重保真

粗体导语、小节标题、hyperref 链接框都在原位;重排式工具最常丢的就是这些(细节②)。

漏翻会被打回

对象级 QA 统计每块中文覆盖率,定义/引理这类整段漏翻直接判缺陷、带清单重译(细节③)。

页面几何逐像素一致

导师说「看第 4 页式 (5)」,中英两版位置相同——重排式译文做不到与原文互相定位(滑块对比)。

质量可自证,盲区会被补上

每份产物附 QA 报告与 inspect 审计,未过检进入只接受严格变好的修复循环;实测暴露的 QA 盲区当天变成新检测器(机制)。

不止一个翻译器

双语对照阅读器、Agent Skill、断点续跑的批处理——是一套读论文的工作流,不是一次性转换(两种形态)。

口径说明:「直接丢给大模型」列为同一后端(deepseek-v4-pro)对整页 pdftotext 文本的单轮翻译,输出按聊天界面的真实能力呈现(markdown + KaTeX 渲染,渲染失败处即模型自身输出的 LaTeX 缺陷); pdf2zh 是同类开源方案中的优秀代表,其默认后端为逐句机器翻译,本对比聚焦版式与结构保真而非译文文采; SuperTranslate 产物均为单遍翻译 + inspect 审计:DPO 展示页 0 缺陷(全篇 3 处报告集中在附录样例框);Mistral 7B 首次实测 inspect 报 0 issue 却漏掉了表 4 与提示框两处真实缺陷,这次实测直接换来了四个引擎修复和两个新检测器,展示图已更新为修复后的 live 重跑产物(inspect 0 issue,且新检测器在旧产物上能报警)。 引擎来源:DPO 这组图由当时开发中的引擎工作区产出,用仓库已发布引擎重翻替换已排队(等 API 额度);Mistral 7B 一组完全由已发布引擎产出,可直接复现。 三侧完整命令、提示词、版本与环境记录于 NOTES.md,欢迎复现。

Positioning · 优势对比

相比其他读论文的方式,优势在哪里

各方式定位并不相同:硬读原文最忠实但最慢;聊天粘贴最轻但丢版式;重排式工具翻得快但版面失真。SuperTranslate 补的是它们之间缺失的一层——译文与原文逐像素可对照、质量可自证。此表为定位对照而非优劣评判,别家能力描述基于公开文档(2026-08 查阅)。

能力 硬读英文原文 GPT / Kimi 粘贴 Google 文档翻译 沉浸式翻译 pdf2zh SuperTranslate
中文母语阅读速度 纯中文 / 双语 PDF
版式保持 原文即版式 近似¹ 对照式¹ 重排实现¹ 逐像素一致
独立公式完整 易乱码¹¹ 声明保留¹ 冻结不经模型
行内公式嵌中文句n/a¹¹ 断行后仍原样
图表与图注 图不翻¹¹¹ 图文保护+图注翻译
长文档(75 页级) 但最耗时 上下文受限 大小限制¹¹¹ 75/75 页实测
术语一致性 取决于读者 漂移 1,066 条语料+可扩展
双栏对照阅读器 网页交错 双语 PDF¹ 同步滚动
译后 QA 审计n/a¹ 对象级+严格变好循环
Agent 一句话集成 无版式 Claude Code / Cursor Skill
批量处理¹ CLI¹ 并行+治理型批处理
本地部署 · 数据不出机 扩展+云¹¹ Docker / uv 自托管
开源可审计n/a 本体闭源¹ AGPL¹ AGPL + QA 证据公开

✓ 具备 · ◐ 部分具备/视情况 · — 不提供 · ¹ 基于各工具公开文档(2026-08 查阅),欢迎指正;「GPT / Kimi 粘贴」与 pdf2zh 两列已补同机实测图像对比(DPO、Mistral 7B 两篇),见「横向实测」

How It Works · 实现机制

从原页,到可信译文

结构先冻结、术语库逐块注入、正文才翻译;QA 未过检就进入 Agentic 修复循环, 只接受严格变好,否则回滚——版式「一个像素不动」靠的不是运气,是这三张图里的设计。

只接受严格变好的翻译

每轮 QA 重跑同一组检测器;候选只有严格减少错误与问题总数才被接受,否则立即恢复修复前快照。

确定性 QA 循环图:检测、缺陷清单、有界修复、候选分数比较,严格更好才接受,否则回滚快照

修复者不能给自己打分

修复方只写候选、审查方只读挑错,双方都不能自行放行;快照比较保留全局最佳,最终由 strict gate 决定是否交付。

独立审查-修复协议图:可写修复方与只读审查方权限隔离,快照保险库、候选裁决与 strict gate 终审
逐对象解析,不重排页面文本块携带页码、坐标、字号与语义角色,后续始终以原页为几何基准。
公式与引用先冻结数学片段、引用和 URL 先转为可逆占位符,保护区不交给模型改写。
多模型共用一套约束DeepSeek、OpenAI 兼容端点与 Anthropic 协议共享结构提示和术语注入。
批处理缓存减少重复调用双阈值分批、JSONL 缓存和有界网络重试共同控制成本与失败面。
原坐标回填,字体自适应只擦除可替换文字,再以 CJK 字体链在原 bbox 内排版。
Golden 回归守住发布线Golden case 与发布基准复用同一 QA,并由 strict gate 校验证据与回归。

想要一张图看完整技术细节?完整单图版 ↗,代码级讲解见 MECHANISM.md

Terminology · 专业术语库
1,066

条精编术语 · 23 个分类 · 3 份语料

  • 348 基础语料:cs / ml / math / general
  • 251 AI 顶会语料:NeurIPS-ICML-ICLR、CVPR、ACL、agents-safety 等 5 类
  • 467 顶会分 track 语料:14 个 track(NeurIPS 理论、ICML 优化、CVPR 3D 重建…)
PAC-Bayes BoundPAC-贝叶斯界 Rademacher Complexity拉德马赫复杂度 Score-Based Generative Model基于分数的生成模型 Partially Observable Markov Decision Process部分可观测马尔可夫决策过程 Amortized Inference摊销推断 Uniform Convergence一致收敛

专为学术翻译设计:翻译每个文本块时按相关性检索术语注入提示词(不整库硬塞); 专有名词首现写作「中文术语(English Term)」、之后只用中文; CI 以 corpus-lint --strict 做跨领域一致性门禁,译后再审计术语采用率。

而且随你扩展:一条 corpus-add 命令加词;或把自己领域的词表 JSON 丢进 corpora/ 目录即自动加载,同名条目以你的为准;翻译中收集的术语候选还有 review → audit → promote 流水线批量入库——改完 corpus-lint --strict 把关即生效。

Features · 核心能力

为「读论文」这件事做深的每一层

从版式引擎到 QA 审计,从 Web 工作台到 Agent Skill——同一套引擎,覆盖个人精读与课题组批量两种节奏。

保版式翻译引擎

原页尺寸、图片、矢量图形与文本块坐标全部保留,译文原位回填;CJK 字体子集嵌入,产物紧凑。

对象级 QA 审计

漏翻、保护区改动、版面重叠 / 空页 / 图片丢失、术语一致性逐对象检查,输出机读 *.qa.json;质量环仅在错误分严格下降时替换产物。

多 LLM 后端

DeepSeek、Kimi K3、OpenAI、Claude、GLM、Google 随时切换;per-user API key AES-GCM 加密存储,不进日志不回传。

双栏对照阅读器

原文 / 译文左右同步滚动,分割线可拖;纯中文 _zh.pdf 与双语 _dual.pdf 都能下载。

批量与断点恢复

多篇队列、任务崩溃后自动恢复、翻译缓存复用——重试不重复消耗 API 额度;大文件分块续传。

Agent Skill 模式

在 Claude Code / Cursor 里直接说「把这篇翻成中文」,Skill 按 SOP 跑完翻译 + QA 全流程,达标才交付。

本地部署 · 数据私有

自托管 FastAPI + SQLite,论文与 API key 不经第三方;AGPL-3.0 开源,网络服务须向用户开放源码。

长文档稳定

75 页 Cosmos 技术报告全篇翻译,QA 75/75 页零问题;30 分钟级长任务可排队、可取消、可恢复。

Two Modes · 双模式

同一个引擎,两种打开方式

Web 部署给课题组共用,Agent Skill 给生活在 AI 编辑器里的你——底层同一套翻译引擎与 QA 体系。

MODE 1 · WEB 部署

浏览器里的论文翻译工作台

http://localhost:8001 · 双栏对照阅读
EN
ZH
示意:左右同步滚动,虚线框为公式保护区(原样保留)
  • 拖拽上传(单文件 100MB、分块断点续传),实时进度与逐步日志
  • 每个账号自己的 API key,AES-GCM 加密落盘
  • 扫描版 OCR、批量队列、飞书完成通知
  • 一条 docker compose 起服务,数据全在自己盘上

适合 实验室 / 课题组共用一台服务器,手机平板也能读

MODE 2 · AGENT SKILL

在 Claude Code / Cursor 里一句话翻译

claude · skills/paper-translate
把 paper.pdf 翻成中文,保留版式
[skill] paper-translate 已激活
corpus-lint --strict ✓ 术语库一致
translate --preserve-graphics-text(公式/图表冻结)
QA:漏翻 · 保护区 · 版面 · 术语 ✓ 全部通过
产出 paper_zh.pdf · paper_dual.pdf · qa.json
示意输出:QA 不达标时 Skill 会继续修复或如实报告,不会静默交差
  • skills/paper-translate 链接进技能目录即用
  • SOP 内置严格 QA 门槛:零错误 + 视觉分达标才算完成
  • 翻译缓存确定性重放,基准批次自带门控脚本
  • 也可脱离编辑器直接走 CLI:python -m pdf_zh_translator translate

适合 重度 agent 用户、批量翻译与可复现实验场景

Product · 产品界面

真实界面,真实速度

以下全部为真实运行截图(本机离线复现,未做修饰); 演示动图是「上传 → 翻译 → 双栏阅读」的完整流程。

localhost:8001 · 论文库 → 翻译 → 双栏阅读 DEMO
真实运行录屏 · 1600px 高清 · 24 秒(全流程实测 75 秒)GIF 版 ↗
论文库界面截图
论文库状态、标签与「译文 / 双语」入口一目了然
上传界面截图
拖拽上传多篇排队,大文件分块断点续传
双栏对照阅读器截图
双栏对照阅读左原文右译文,同步滚动、分割线可拖
API 设置界面截图
API 设置每个账号配自己的供应商 key
Bring Your Own Key · 自带 API Key

用自己的 key,数据不出本机

本地部署:论文、译文与 API key 都留在你的服务器上,key 加密存进本机 SQLite,界面只显示尾号。

localhost:8001 · API 设置 LIVE
API 设置弹窗:DeepSeek 已配置(演示 key),其余供应商待配置
DeepSeekKimiOpenAI 兼容AnthropicGLM
WEB
Web 界面配置登录后在「API 设置」里按账号填写;AES-GCM 加密落盘,不进任务文件、不回传浏览器。
ENV
.env 环境变量服务器级兜底(本机管理员用),如 PAPER_CHINA_DEEPSEEK_API_KEY;docker compose 一并读取。
CLI
命令行 --api-key-env只传环境变量名不传值,key 不出现在命令行、日志与翻译缓存里。
Numbers · 质量证据

每个数字,都有证据指针

75/75Cosmos 75 页全篇翻译
QA 通过页数
0上述全篇审计 issue 数
(793 个审计对象)
30 篇基准论文批次
经典 20 + 世界模型 10
1855自动化测试用例
1,066专业术语库条目
23 个分类 · 3 份语料
6可切换 LLM 后端

事实纪律:以上数字对应仓库内基准清单、QA 报告与测试套件,均可复核;「75/75 · 0 issue」指 75 页《Cosmos World Foundation Model Platform》全篇翻译的正式 QA 结果。

Quick Start · 快速开始

两条路,都是几分钟的事

部署成课题组网站,或装进你的 AI 编辑器——选一条开始。

git clone https://github.com/asimfish/super_translate.git
cd super_translate
cp .env.example .env        # 填入 LLM API key 与访问令牌
docker compose up -d --build

打开 https://你的域名(或本机端口)即可上传第一篇论文。VPS + 自动 HTTPS、备份与排障见 部署指南; 不想用 Docker 也可以 pip install -e . 后用 uvicorn 起本机服务,见 中文教程

git clone https://github.com/asimfish/super_translate.git
# Claude Code(全局技能目录)
mkdir -p ~/.claude/skills
ln -s "$PWD/super_translate/skills/paper-translate" ~/.claude/skills/paper-translate
# Cursor:改为链接到你项目内的 .cursor/skills/ 目录

然后在对话里直接说:「把 paper.pdf 翻译成中文,保留原版式」。 Skill 会按 SKILL.md 的 SOP 完成术语预检、翻译与 QA 审计,达标才算完成。