08/22 Tl.4 「Token」真的需要一个翻译吗?
本篇 OMI 仅限于讨论翻译与 AI 相关内容,不能作为任何专业参考文章使用。
被敲定的过程
AI 的浪潮一次一次的滚了过去,直到 OpenClaw( 又被称为 该死的 小龙虾 )火了一阵子,国家出手了:嘿你看,不管之前的 DeepSleep 还是现在的 OpenClaw 都在用 「Token」 这一极其重要的 英文单词 计算费用、消耗、 不管它什么东西 ……而且它现在还没有一个规范译名!?哦不不不我无疑是愤怒的,但是我也不怎么懂,让我们公开募集一个合适的译名吧!
于是经过一段时间的大讨论 夹杂着各种牛马蛇神的神发言 ,2026 年 3 月 24 日,「全国科学技术名词审定委员会」正式地将「Token」的翻译定为了「 词元 」。
为什么要确定一个译名,而不是放任不管?
诶,这时候就有聪明的同学要问了, MM,为什么一定要给它确定一个译名,而不是放着不管、或者就用 Token 呢? 好问题(无感情)!这个问题,还得从 AI 发展的一开始说起……
前几年真是疯狂的几年,仿佛 ChatGPT 4o 刚刚发布一般——那时 AI 刚刚进入人们的视野,而 Token 作为现阶段 AI 架构最重要的一部分,自然而然地慢慢火了起来。
所以什么是 Token 呢?
什么是 Token
Token 在 AI 发展之前其实就在很多领域得到了运用。比如网络安全领域,这其中的 Token 就代表用来验证身份或者授权的凭证——相当于一种特殊的钥匙卡,服务器和电脑可以通过 Token 验证对方的身份。自然而然地它就被翻译成了「密钥」(冷知识:它读 mì yuè,如果你还不知道的话(x))其他领域也有相关翻译,如「令牌」「凭证」等等。
而在 AI 领域中,它代表一种可以被分割出来的最小的单元词汇,相当于把一句用户的输入分成一段段词汇。比如:
让我们学习这句句子:
I'm working on some tasks related to studying Large Language Models.可能被分为这样:
让/我们/学习/这句/句子/:/
I'm/working on/some/tasks/related to/studying/Large Language Models/.以 / 表示分隔符,每个被 / 包起来的字词即可视作一个 Token。而不同的模型,分词器 (Tokenizer)——即把一句句子分割成一个个 Token 的东西——通常也不同。比如,有的分词器会把 这句句子 分为一个 Token,中文优化差的可能会把每个中文字符分为一个 Token。而 AI 模型根据分词器与提示词,一个个根据算法预测出下一个词最可能是什么:
我问他,今天天气 _
怎么样 65%
好吗 25%
是 5%
……(仅作实例),然后依次输出: 我问他,今天天气怎么样 _,再接着预测下一个词。当然,这里只是对最常见的最低级的 AI 模型做的一个最粗劣的模仿,如果你想了解更多相关知识,可以自行搜索。
原因是什么呢?
随着 AI 进入大众视野,它已经不再是一个简单的「词汇单元」:服务提供商用 Token 作为单位计费、还有上下文窗口(比如各位常听说的「最大 1M 上下文」等)的计量、性能衡量(每秒几个 Token 能输出、第一个 Token 输出要多久等)的单位之类……Token 再怎么说也是外文词汇,虽然「专业人士」可能早已习惯,但人民群众就不是了。
更别提,Token 现在连调用量都可以成为一个被对比的变量——诸如 GDP 之类——不知道各位同学看新闻的时候有没有注意到像「中国 Token 调用量第一」这种新闻,虽说我看「断章取义搞对立」被这种不知道该说什么好的媒体是学透了,调用方法和统计方式是一个没提(最近的貌似是 OpenRouter 平台中国模型总调用量第一,其他啥渠道都不算),不过这也侧面证明了 Token 不仅要比谁出得快,也要比谁出得多了。而「Token 调用得多」,其实某种方面还是「基建好」「产能强」的印证,毕竟用来放模型的提供方需要大量足够强的服务器,足够强的 GPU 卡,还有配套的水电等等一系列措施保证一个数据中心的建立——这下看懂了。
于是,在一轮一轮 AI 工具爆火之后,确定一个 Token 的译文,尤其是 标准译文 便迫在眉睫。
为什么是它?
以前是以前……
这个词其实大有渊源。2020 年,国内就已经有深度学习之类的书本出版——虽然这种书主要面向的是科研方面,但是那时 Token 的译名词元(以及配套设施,「词元化」= Tokenizer 等)就已经被写下了。
而它有哪些对手呢?
大 PK!?
国家一号召,各家不管是科研人员、还是商业人士、甚至搞抽象的都凑过来了。为什么争个译名这么重要呢?其实我也没搞太懂,骗你的,我当时都没太关注这件事……不过话都说到这了,我们就来看看这些候选项:
- 智元 —— 我去,好熟悉的名字。虽然据说王小川都在支持,但反正我是不支持,你真的喜欢看新X元给你推送 AI Slop 文章吗?
看这些不如多看看 OMI 啊 - 符元 —— 有道理,但太像道家名词了,过于神秘(x
- 模元 —— 只突出了「模型」的模,那其他的咋办呢?
- 数元 ——
要我说它比符元更神秘 - 语元 —— ……
- 字元 —— ……
你别管它们是怎么被 PASS 的,来看点有意思的。
- https://t.cj.sina.com.cn/articles/view/5703921756/153faf05c01903il1o | 新智元正主来了😰
- https://tieba.baidu.com/p/10586568589 | 哈威 | 哈基米哈气 be like
- https://www.163.com/dy/article/KOIQK55P0519EA27.html | 看得出来偷感很重
- 甚至我以前看到翻译成
滚木的,还有能把 AI 翻成硅头的…… ctmd 我都在看什么……
严正声明!以上词汇均无其他意思!
结果
于是「词元」就被定下来了。(无感情x2)
说实话,我其实挺喜欢这个翻译的,「词」代表了它「像什么」,「元」则是汉语中古老的一个字,表示「基本的单元」。而且这个词汇读起来不拗口,相较于上面几个个人觉得还更有「科技感」而不是「神秘感」,自然而然地也就接受了下来。
但是最近我开始反感这个翻译了。
为什么它不好
诶这个时候又有同学要问了, 诶 MM 你刚说它好怎么又说不好了呢? 我知道你很急但你先别急,先听我慢慢讲。
自从国家定下来这个标准翻译之后,说好的说坏的声音都有,我倒是不怎么在意,毕竟我第一不怎么用这个词汇第二要说也是说 Token,基本不会说中文(?)来避免争端(?)。媒体们也开始用这些中文词汇一步步替换原有的外文词汇,虽然这大部分情况是好的,但就在最近一两个月,出现了我比较痛恨的一个词:
抱抱脸 。
我第一次看到这个词汇是在读 RSS Feed 的时候 —— 当时我就想,「这™啥玩意,,,」,后来一联系上下文才知道,「哦原来这玩意是™的 Hugging Face 。?」
给不知道的同学解释一下,Hugging Face 就如同编程界的 GitHub 一样,提供了各种稀奇古怪的模型、数据集等 AI 相关材料的托管与下载服务。以前用 Hugging Face,这个名词就没什么:一家国际性的平台,正如 GitHub 一样。可是它被翻译后呢? 抱抱脸 。我的输入法词库甚至都没有这个词汇。WTF is this bro,,, 这就正如 GitLab 变成了「极狐」(冷知识,「极狐」真的存在,而且是 GitLab 在中国的正版经销商)一样。我不反感「极狐」,因为它即是一种……不知道虚不虚构……应该是虚构的动物命名的,对我来说,「极狐」正如「GitLab」一般是个专有名词。可是「抱抱脸」呢?很明显,这个译名是直译。虽然我不是专业翻译者,学历不高,但是很明显这个译名想要营造一种「有亲和力」的氛围,来让它的受众更容易接受。但是 Hugging Face,也正如 GitHub,普通人不会经常接触,只有经常混 AI 圈的大蛇(不是我😭😭😭)才经常光顾此地。所以,原来的英文带来的专业感瞬间化为了灰烬,正如 GitHub 变成了烂梗「给的地盘」,让我避之而不及。
跑题了,其实真正让我开始讨厌「词元」、甚至整个这个「为什么一定要翻译」的怪圈的原因,是 滥用 。
相信经常水群的同学也知道了前一阵子 Token 被错翻乱翻的案例,原本各个领域分开翻译的 Token,全都被翻成了同一个词汇——你就偷着乐吧,想想「黑客趁你不注意偷走了你的安全词元」这句话有多好笑。「词元」原本只适用于 AI 领域,而这句虚构的话我相信绝大多数人类都能看出是网安领域的,本该被翻译成「安全密钥」的句子变成了「安全词元」,我也就真就搞不懂为什么低调的黑客要偷一个词语去干嘛了,得这全体人类不能玩烂梗而我的玩梗等级不变是吧。
而最不应该发生的,恰恰是 Token 原本能够被翻译正确、所有人都能听懂的情况下,有个人偏要把所有「Token」翻译成「词元」,不用的就要鸡哔你一样。能定个翻译固然是好事,搞「文字yu4」类似物那就不对了。
所以,应该不应该被翻译
最终,我们还是来到了这个终极问题。
Token 应不应该被翻译?如果是,译文会是什么?
很显然,后面一个问题已经有答案了。让我们来看前者。
首先,如果一个译名能够被广泛使用,盖过原来的英文(甚至是在英文原本很常用时),那么这个翻译肯定是理所应当的。
比如同样拿 AI 领域的名词来讲:「大模型」。
大模型,原文 Large Model ,是指规模参数大、结构复杂的深度学习模型。我们常说这个大模型、那个大模型啥的,但几乎没什么人会说这个 LM、那个 LM 的;它的表兄弟「大语言模型 LLM」也一样。
虽然这其中也有读法便捷(LM 有 4 个音节,「大模型」只有 3 个),拜我们的老祖宗所赐,或者是原文是几个词而 Token 是一个词等等因素——但最主要的原因还是它们在大众群体被更广泛地接受了。如果你觉得这两个词太长,还可以看看 Model ——一般不会有人直接说这个词,但提到 模型 很多人立马就来劲了。同样我也要指出,这个例子也不是特别好,因为 Model 在其他领域很多时候也被翻作「模型」,但是这几个例子都共同说明了一点:「 原名/译名最重要的是被广泛接受,一旦被接受就不会经常改变 」。
而 Token 经过长时间的沉淀,当它已经成为一种惯用叫法时,再想改变,可就难了。
那么好,感谢你阅读本篇超————————长的 OMI Tl(居然包括标点和英文已经有 4.6k 字了难以置信……),这里是 OhMyIWB,欢↗迎↘下↝次↘光↗临-~