开源翻译已经走到了终点
曾经有一段时间我很钟情于为开源项目贡献中文翻译,这是一种在没有AI的蛮荒年代里也可以向开源项目做出贡献的办法,然后你就可以骄傲(心虚)地说你也是某某项目的开源贡献者。但在向多个开源项目提交过翻译后,我决定不再继续浪费我的时间在这种事情上,因为已经没有太大的意义了,巴别塔虽然没有倒下,但是人类给他装上了电梯。
前言
这篇文章中的大部分内容在我看来都已经没有了意义,通用大语言模型(LLM)如同泥石流一样席卷了所有人,现在我们身处一个充斥着混乱的新世界,新世界中自然萌发了不少代表着新生、希望和未来的新芽,但也掩埋了不少旧时代的残党。而开源翻译很明显已经走完了需要人类参与的道路,这个领域已经不再需要绝大部分外部志愿者的参与。
旧约
旧时代的开源翻译往往面临着很多问题,大部分项目都可以归纳为以下两种场景:
- 翻译并不是我们软件中优先级较高的任务,我们人手紧缺,核心开发者连代码都写不完。即便有人提交了翻译PR,也要占用核心开发者的时间去审核,而这些开发者往往对这些陌生的语言一窍不通——否则他们早就亲自把这个事做了,于是到这里就变成了一个非常经典的信任问题:即我该如何确保这些翻译是否符合质量要求呢?为此他们想到的第一个念头就是,我们得找一个值得信任的、有该语种经验的人来把关,也就是翻译平台中的语言经理这一职位。在没有找到这样的人之前,你的PR只好被一直搁置下去。顺便说一句,因为你是新面孔,所以他们自然也不接受你自荐为该语言的语言经理😊。
- 我们根本不在乎。
我试图提交翻译的大部分开源项目都属于第一种状态——有着全套的基础设施:Crowdin 和CI/CD,甚至在Crowdin上的翻译进度已经达到了100%,但是没有人批准这些翻译,因此用户永远也看不到翻译者的劳动成果。就像下图一样。
![]()
而有的项目即便已经商业化,但是他们仍然不在乎多语言,这一点和游戏有着很大的不同,现如今游戏开放商都知道如果游戏不支持多语言(尤其是简体中文),会损失很大一部分销售额,但是在软件社区里,部分开发者会有着“即便没有多语言支持,该用的人还是会用”、“作为技术人员掌握英文是基本要求,因此没有必要添加其他的语言”的观点,在专业性较强的软件里,这样的情况会更严重。比如说,一款截图软件,他支持简体中文的概率会比一款数据库管理软件大不少。举个例子,Sentry就属于不在乎的那一类:作为错误追踪SaaS领域的行业寡头,甚至几乎可以说是牌桌上唯一上得了台面的玩家,他的多语言支持现状如下:
![]()
从上图就可以看到,Sentry基本没有任何一个语言处于完整可用状态,他们就是不在乎而已。毕竟当你是这个领域唯一的寡头,工作做到70分和100分没有任何区别。
最后,我还要指出一点,由于翻译工作往往被视作没有什么技术含量的低级贡献,因此大家对译者和翻译内容的尊重程度也不往往如开发人员。我曾经在2023年左右为 WeMOD(Wand) 贡献过一些翻译,然而突然有一天,整个翻译项目都从Crowdin公共平台上消失了,软件UI上的“请大家帮助我们本地化”的入口也删掉了,白茫茫一片大地真干净。无数志愿者的工作成果就这样被私有化了,而WeMOD甚至没有想过找个地方写上他们的名字然后说句谢谢。开源软件的权益有开源许可证保护,而翻译成果呢?什么也没有。
新约
以上种种,严重打击了我对开源项目提交贡献的积极性,好在有一些小项目: Royal TSX、Umami、Hono Docs、DIM、BrayTech、Tarkov-dev 还是很积极地批准了我的贡献,让我获得了一些小小的满足感。然而这种“小确幸”的时光并没有持续多久——LLM来了。
LLM不仅彻底且一劳永逸地摧毁了大部分翻译的工作机会和存在价值,也顺带碾死了DeepL这样的“传统”机器翻译平台。请参考下面的DeepL和LLM的成本对比表:
| 服务商 / 模型 | 计费方式 | 官方单价(每百万) | 翻译 100 万字符估算费用 | 折合倍数(以最贵为 1) |
|---|---|---|---|---|
| Qwen(qwen-plus) | 按 token(阿里云百炼) | 输入 ¥0.8 + 输出 ¥2.0 | ≈ ¥0.70 | ≈ 1/254 |
| Qwen(qwen3.8-flash) | 按 token(阿里云百炼) | 输入 ¥0.8 + 输出 ¥2.7 | ≈ ¥0.88 | ≈ 1/202 |
| GPT-5.6 Luna (OpenAI) | 按 token | 输入 $0.20 + 输出 $1.20 | ≈ $0.35(≈ ¥2.5) | ≈ 1/71 |
| Kimi K2.6 (Moonshot) | 按 token | 输入 $0.95 + 输出 $4.00 | ≈ $1.24(≈ ¥8.8) | ≈ 1/20 |
| Kimi K3 (Moonshot) | 按 token | 输入 $3.00 + 输出 $15.00 | ≈ $4.50(≈ ¥32) | ≈ 1/5.6 |
| DeepL API Pro(存量) | 按字符 | $25/百万字符 + $5.49/月基础费 | ≈ $30.5(首月,≈¥217) | ≈ 1/7.3(次月起) |
| DeepL API Growth(新) | 按字符 | $26/月(含 1200 万字符/年) | ≈ $26(≈ ¥185) | 1 |
换算假设
- 统一基准:100 万字符 ≈ 25 万输入 token + 25 万输出 token(英文约 1000 字符 ≈ 250 token)
- 中文文本 token 密度更低(1 字通常 ≤1 token),大模型实际成本还会更便宜
- DeepL 直接按源文本字符计费,无 token 换算损耗;文档翻译有每篇 5 万字符最低计费
- 人民币按 1 USD ≈ 7.1 元粗算,汇率以实际结算为准
如果你在DeepL里工作,我对你深表同情。
更讽刺的是,今天的LLM,已经全面超越了其最初研发的使命——机器翻译。现在,翻译只不过是LLM众多能力中最最微不足道的一环。
于是突然之间,开源翻译所有的问题都不复存在了:不再需要依赖社区来贡献翻译了,不再需要纠结翻译复核和信任的问题了,连准确性的问题都不太需要考虑了——LLM不仅翻译得快,还能直接读代码根据业务上下文使用准确的专业术语,这在以前可是完全无法想象的。
现在开源翻译唯一的阻力就变成了:作者到底愿不愿意花5分钟的时间来加上所有语言的翻译。 我前段时间看到了一个刚起步的开源软件,于是我点开Github想看看它是否需要多语言支持,结果呢?代码仓库里安静躺着十几种已经翻译就绪的语言文件,我点开简体中文大概扫了一遍,比我想象得还要好,至少对于开源软件而言这已经是非常优秀的可用程度了。那一刻我意识到,开源软件领域已经不再需要传统意义上的翻译贡献者了。
接下来怎么办?我不知道。语言专业的学生们应该也同样迷茫。LLM确实带来了变革,但是没有带给我们关于出路的答案。