六个模型翻同一篇文章:本站怎么选翻译模型
更新于 2026-10-05
翻译差一截,整站读起来就不一样。译文要长期留在站上,所以先拿同一段原文,让几个模型各译一遍,看它们差在哪,再决定以后用哪一个。
试译的是 poteto 的文章《我怎么用 Cursor》(How I Use Cursor)的前半篇,大约 1165 个英文词,共 26 段。
六个模型的推理强度都是 high。claude-opus-5-5、kimi-k3、glm-5p3、gpt-5.6-sol、grok-4.7、gemini-3.1-pro。再加上当时的本站旧译文,一共七份。
七份打乱顺序,标成 A 到 G。打分时不看模型名,打完才对上。五项各 5 分,满分 25 分。准确,看误译和漏译。术语表,看该留的英文有没有被译掉。不加戏且保留语气。结构对齐,看段落和列表有没有被改乱。中文自然度,看读起来像不像人写的中文。
26 段对齐的全文在七份译文逐段对照。
总分和分项分
Section titled “总分和分项分”| 名次 | 译文 | 准确 | 术语表 | 不加戏 | 结构 | 自然度 | 总分 |
|---|---|---|---|---|---|---|---|
| 1 | claude-opus-5-5 | 4.5 | 5 | 5 | 5 | 4.5 | 24 |
| 2 | kimi-k3 | 5 | 4 | 5 | 5 | 4.5 | 23.5 |
| 3 | glm-5p3 | 4 | 4 | 4.5 | 5 | 5 | 22.5 |
| 3 | gpt-5.6-sol | 4.5 | 5 | 5 | 5 | 3 | 22.5 |
| 5 | grok-4.7 | 3 | 3.5 | 4 | 5 | 3.5 | 19 |
| 6 | 本站旧译文 | 3 | 2 | 5 | 5 | 3 | 18 |
| 7 | gemini-3.1-pro | 3 | 3 | 5 | 4 | 2 | 17 |
手机上这张表可以横向滑动。
下面五句拉开的差距比较大。英文是原句。中文从各份译文里原样摘出。点评只用这次打分里已经写下的判断。没带点评的,是这次打分没有单独评的。
The sticking point for me was in developing my own set of skills
Section titled “The sticking point for me was in developing my own set of skills”这一段的七份对照在逐段对照第 3 段。
- claude-opus-5-5:「真正让我离不开它的,是我自己攒下的一套 skills」。译出了「让人上瘾、离不开」,没有理解成阻碍。
- kimi-k3:「最让我着迷的是打造自己的一套 skills」。这次打分把这句算进译对的难点。
- glm-5p3:「最让我着迷的,是自己写一套 skills」。
- gpt-5.6-sol:「真正吸引我的是开发自己的一套 skills」。这次打分说难点全对,这句算在里面。
- grok-4.7:「我的卡点在于自己做一套 skills」。意思反了,和本站旧译文是同一类错。
- 本站旧译文:「卡住我的地方是:我想自己做一套 skills」。把让作者离不开 cc 的原因说成了阻碍。
- gemini-3.1-pro:「对我来说,难点在于开发自己的一套 skills」。这次打分把「对我来说,难点在于」标成误译。
But we need to go depth first.
Section titled “But we need to go depth first.”这一段在逐段对照第 19 段。
- claude-opus-5-5:「但我们得深度优先。」用了中文里常见的「深度优先」,原文那个双关也在。
- kimi-k3:「但我们得先往深里走。」这次打分把这句算进译对的难点。
- glm-5p3:「但得先往深里做。」
- gpt-5.6-sol:「但我们得先向深处走。」这次打分说难点全对,这句算在里面。
- grok-4.7:「但我们得先做深。」这次打分说这一句是对的。
- 本站旧译文:「但我们需要 depth first。」半句英文留在中文里。
- gemini-3.1-pro:「但我们需要优先做深。」这次打分说这一句是对的。
people can abuse it for other use cases
Section titled “people can abuse it for other use cases”英文原句是 “There’s this really old idea in product called latent demand… you build a product in a way that is hackable, that is kind of open-ended enough that people can abuse it for other use cases. Then you see how people abuse it and then you build for that.”
这一段在逐段对照第 11 段。
- claude-opus-5-5:「产品领域有个很老的想法,叫潜在需求……你把产品做得可以随便折腾,足够开放,让人能把它滥用到别的用途上。然后你看人们怎么滥用它,再照着这个去做产品。」
- kimi-k3:「产品领域有个很老的说法叫潜在需求……你把产品做得容易改造、足够开放,人们就会拿它折腾出别的用法。然后你观察大家怎么折腾,再照着那个方向做。」用「折腾」处理 abuse,自然,意思也在。
- glm-5p3:「产品圈有个很老的想法,叫潜在需求……你把产品做得可以折腾,开放到人们能拿它去干别的用场。然后你看大家怎么折腾它,再照着那些用法去造产品。」
- gpt-5.6-sol:「产品领域有个非常古老的概念,叫作潜在需求……你用一种可改造的方式构建产品,让它足够开放,使人们能拿去做其他用途。然后观察大家怎么使用它,再针对这些用法来构建产品。」把 abuse 弱化成「拿去做其他用途」「观察大家怎么使用它」,「滥用、折腾」的意思没了。
- grok-4.7:「产品这行有个很老的概念,叫潜在需求……你把产品做得可以魔改,也算开放到足以让人把它滥用到别的用途上。然后你看人们怎么滥用,再照着那个做。」这一段译了,「你把产品做得可以魔改」。
- 本站旧译文整段留成英文,和作者自己的推文引文译了的处理不一致。
- gemini-3.1-pro:「产品里有个很老的想法叫潜在需求……你把产品做得很 hackable,足够开放,以至于人们可以为了别的用例来滥用它。然后你看看人们是怎么滥用的,接着你就为那个需求去构建产品。」「你把产品做得很 hackable」是中英夹杂。
felt smarter, somehow
Section titled “felt smarter, somehow”英文原句是 First, the models I was used to at the time - Opus and Codex - felt smarter, somehow.
这一段在逐段对照第 5 段。
- claude-opus-5-5:「不知怎么变聪明了」。丢了「感觉」二字,把作者的主观感受说成了事实。
- kimi-k3:「感觉莫名更聪明了」。
- glm-5p3:「在这里不知怎么感觉更聪明了」。
- gpt-5.6-sol:「不知为何感觉更聪明了」。
- grok-4.7:「不知怎么就感觉更聪明了」。
- 本站旧译文:「不知怎么感觉更聪明」。
- gemini-3.1-pro:「不知怎么的,感觉更聪明了」。
They’re capable yet stupid, and very teachable.
Section titled “They’re capable yet stupid, and very teachable.”这一段在逐段对照第 15 段。
- claude-opus-5-5:「它们有能力,却很笨,而且很好教。」
- kimi-k3:「他能干,但笨,而且特别好教。」这一句用「他」指 agent。这次打分点名的是同一段里的「你跟他说的话他记不住」,下一段又换回「它们」。
- glm-5p3:「它们有本事,却又蠢,还特别好教。」
- gpt-5.6-sol:「它们有能力,却也愚笨,而且非常容易教。」同一段里被点名的是后面那句「我把它们的各种失败模式视为机会,可以借此教会它们我所知道的一切,做深入、严谨的工程工作。」
- grok-4.7:「它们有能力,但很蠢,而且很好教。」
- 本站旧译文:「他们能干又蠢,而且很可教。」照搬英文结构。
- gemini-3.1-pro:「它们有能力但又很笨,而且非常容易教。」
claude-opus-5-5
Section titled “claude-opus-5-5”第一名。几个公认的难点都译对了,术语表和标点规则全部遵守。
好的地方。原文 The sticking point for me was in developing my own set of skills 译成「真正让我离不开它的,是我自己攒下的一套 skills」,把「让人上瘾、离不开」的意思译出来了,没有误解成阻碍。原文 we need to go depth first 译成「但我们得深度优先」。用了中文程序员熟悉的「深度优先」,原文那个双关也保住了。子代理写成「还能派出不同模型的子代理」。
问题。原文 felt smarter, somehow 译成「不知怎么变聪明了」,丢了「感觉」二字,把作者的主观感受说成了事实。「你这个人自己当编排器」里用「编排器」指人,也稍显生硬。
kimi-k3
Section titled “kimi-k3”第二名。意思最准,口语最活,扣分主要在术语表。
好的地方。@bcherny 的引文译成「你把产品做得容易改造、足够开放,人们就会拿它折腾出别的用法。然后你观察大家怎么折腾,再照着那个方向做」,用「折腾」处理原文的 abuse,自然又不失原意。「信任不够,你就得对每个 agent 都管到最细。你放得开手,才能交出更多。」完全是中文的说法,没有翻译腔。难点也都对。「最让我着迷的是打造自己的一套 skills」「但我们得先往深里走」。
问题。「他们入职时已经带着过去经验训练出的技能」把 skills 译成「技能」,这个词应保留。「你跟他说的话他记不住」用「他」指 agent,下一段又换回「它们」,前后不一致。「到处安利」也偏网络用语。
glm-5p3
Section titled “glm-5p3”并列第三。读起来最像中文博客,但有中英夹杂和几处小偏移。
好的地方。「什么都要用鼠标点,感觉简直原始。」「这比同时开十个问题、在一堆 agent 之间来回切上下文要强。」英文长句重排成了中文语序。
问题。两处写成「对抗式 review」,一处是链接文字,一处在引文列表里,是中英夹杂的半句。「plan 用量」也留了英文。原文 side projects 译成「副业项目」,「副业」在中文里多指兼职赚钱,意思偏了。原文 Get it here 译成「在这里安装」。「你点名要的那段代码」加了原文没有的「点名」。
gpt-5.6-sol
Section titled “gpt-5.6-sol”并列第三。规则执行最干净,意思准确,但读起来像书面公文。
好的地方。难点全对,术语表没有违反。「真正吸引我的是开发自己的一套 skills」「更棒的是还能创建不同模型的子代理」「但我们得先向深处走」。署名行前的长破折号去掉了。
问题。「我把它们的各种失败模式视为机会,可以借此教会它们我所知道的一切,做深入、严谨的工程工作。」句子结构断开,读起来像机翻。「使用 CLI 时,作为人类的你其实就是编排者」里的「作为人类的你」是典型翻译腔。@bcherny 的引文把 abuse 弱化成「拿去做其他用途」「观察大家怎么使用它」,丢了「滥用、折腾」的意味。「近似实现这些能力」「富有成效」这类书面词也偏多。
grok-4.7
Section titled “grok-4.7”第五名。短句做得最彻底,但有误译和过度翻译。
问题。原文 The sticking point for me 译成「我的卡点在于自己做一套 skills」,意思反了,和本站旧译文是同一个错。界面名和行业词被译掉了。「我用的是编辑器窗口」对应 Editor Window,「Agent 窗口」对应 Agent Window,「图形界面能比文本界面多提供多少」对应 GUI、TUI,「命令行」对应 cli。产品名应保留英文。原文的 best of N 改写成「多开几路一起赛」,读者认不出这个常用说法。「不过说实话。」用了句号,是标点错误。
好的地方。子代理和「但我们得先做深」都对。@bcherny 的引文也译了,「你把产品做得可以魔改」。最后一段拆成「插件的核心是 /poteto-mode。它是更高一层的 skill。」短句做到了,只是拆得有点碎。
作参照。句子短,很多地方顺,但误译、英文残留和翻译腔都有。具体句子和后来的改法写在下一节。
好的地方是「到处去点东西,感觉近乎野蛮」「compaction 快得离谱」,读起来很自然。
gemini-3.1-pro
Section titled “gemini-3.1-pro”第七名。逐词直译最多,翻译腔最重,还改坏了一处结构。
翻译腔。「但我不能说谎。」直译 I can’t lie though。还有「天哪,它能写而且会写出一大堆代码」「作为一个 cc 用户」「agent 会谄媚地不惜一切代价」「这完全就像管理人类一样!」,以及「瓶颈依然在于我要努力记住,并在我自己的上下文里保持我的 agent 都在做些什么」。
误译和术语。原文 The sticking point for me 译成「对我来说,难点在于」,是误译。「你把产品做得很 hackable」是中英夹杂。「带着从过去经验里学到的技能」把 skills 译掉了。「大部分快捷键还在我的上下文里」丢了原文「上下文窗口」那个玩笑。
结构。署名行写成 > - [@poteto](…),长破折号被换成连字符,在正文里变成了引文列表的第五项,和原文结构不一致。子代理「派生不同模型的子代理」和「但我们需要优先做深」是对的。
旧译文的问题
Section titled “旧译文的问题”这次对照当时没有改站上的译文。问题分三类。后来《我怎么用 Cursor》用 claude-opus-5-5 重译过。下面每条先写当时的句子,再写现在这一页上的句子。重译后的全文和上面六份试译不是同一稿。
误译。原文 The sticking point for me 译成「卡住我的地方是:我想自己做一套 skills」,把让作者离不开 cc 的原因说成了阻碍。现在这一页是「真正让我离不开它的,是给它开发自己的一套 skill。」
英文残留。「更好的是能拉起不同模型的 subagent」,这里应写成「子代理」。现在这一页是「更棒的是,还能拉起不同模型的子代理」。「但我们需要 depth first。」现在这一页是「但我们得按深度优先的路子来。」「暴露出的 latent demand 是」。现在这一页仍有 latent demand,句子是「正好暴露了 latent demand 在哪:用命令行的时候,编排者就是你这个人。」上一句是「@bcherny 经常讲「latent demand」(潜在需求)这个概念:」。
@bcherny 的整段引文当时留成英文。作者自己的推文引文当时译了,前后不一致。「onboarding」「debug」「side project」「tools」也留了英文,例如「新人需要 onboarding」「怎么 debug」「为自己的 side project 付了每月 200 美元的个人方案」「rules、skills、tools 和长期记忆」。现在这一页对应写成「新人入职要有人带」「怎么调试」「专门给业余项目用」「rule、skill、工具和长期记忆」。引文现在是「做产品有个很老的概念,叫 latent demand……你把产品做得能随便改,足够开放,让大家能把它滥用到别的用途上。然后你看大家怎么滥用,再照着去做。」
翻译腔。「多个 agent 一起尝试复现一个被报告的问题」硬套被动。现在是「让多个 agent 一起尝试复现报上来的问题」。「他们能干又蠢,而且很可教」照搬英文结构。现在是「它们能干,但也蠢,而且非常好教。」引文里 across many agents working on 10 different problems 当时只译成「在 10 个不同问题上切换上下文」,丢了「很多 agent」。现在是「这比让一堆 agent 分头处理 10 个不同的问题、自己在它们之间来回切换上下文要强。」
这次定 claude-opus-5-5,推理强度 high。它 24 分。几个难点句译对了,术语也没译丢。
以后翻译默认用 claude-opus-5-5,推理强度 high。额度用完,或者这个模型名称被拒绝,就按这次的得分顺序换下一个,推理强度仍是 high。先是 claude-opus-5-5,然后 kimi-k3,然后 glm-5p3,然后 gpt-5.6-sol,然后 grok-4.7。每次都写明用的是哪一个,绝不交给工具自己挑。gemini-3.1-pro 这次 17 分,分数最低,所以不在这个顺序里。
这些分数是助手的判断,不是标准答案。本站旧译文助手之前读过,这一份没法做到完全盲评。
有新模型出来,或者读者觉得译文变差,就用同一段原文再比一次。
