《原来如此 | 第06期:大模型时代的“数字黄金”:人人都在谈的 Token 到底是什么?为什么它成了 AI 世界的唯一通用货币?》 1. AI 时代的神秘账单与虚拟符号当你使用 ChatGPT、Claude 、DeepSeek 的时候其实一直在消耗一种 AI 世界里的“计算燃料单位”——Token。API 计费每 100 万个输入 Token 售价 0.14 美元输出则要 0.28 美元以上大模型规格支持 128K12.8 万Tokens 的超长上下文窗口调用账单本次对话共消耗 1,520 个 Tokens。很多人下意识地以为1 个 Token 就等于 1 个英文单词或者 1 个汉字。但实际使用中账单数额往往对不上英文单词 unbelievable在 AI 眼里其实是 3 个 Tokens⚠️在部分 GPT 系列模型的 Tokenizer 中unbelievable 可能会被切分为 3 个 Token输入一句话英文版算 10 个 Tokens翻译成中文版可能就要扣掉 20 个以上。为什么大模型无法直接按我们熟悉的“字数”或数据大小KB/MB来收费和计算这个原本属于计算机领域的生僻词又是如何在短短一两年内传遍全球的在这看似虚拟的数字消耗背后地球上又在发生着怎样的真实物理代价2. 核心技术为什么大模型不能直接读懂人类的文字大模型本质上是一个基于深度学习的概率预测数学模型。它既不认识英文也不认识中文它的底层只认识数字矩阵与向量。把人类的语言文字切碎并转化为数字的过程叫做Tokenization分词/标记化。为了在“词表大小”与“序列长度”之间找到完美的物理平衡科学家曾尝试过两种最直观的方案但它们都在物理极限面前碰了壁方案 A按单个字符Character拆解英文拆成 a, b, c中文拆成单个汉字致命缺陷序列长度Sequence Length呈爆炸式增长。物理瓶颈大模型的核心机制——自注意力机制Self-Attention的计算复杂度与输入序列长度的平方成正比。如果将连贯的英文和汉字全部打碎成单个字母和偏旁部首输入序列会拉长 5 到 10 倍。这意味着计算量将暴涨 25 到 100 倍大模型的内存和算力会瞬间被无意义的超长字符序列榨干。方案 B按完整的单词Word拆解如 unbelievable、running致命缺陷词表Vocabulary无限膨胀。物理瓶颈英语中有数百万个单词再加上各种时态变化run、running、前缀后缀believable、unbelievable、错拼和网络新词词表将趋于无穷大。大模型在加载这些词的特征矩阵Embedding Matrix时需要为每个词分配一个高维向量这将直接撑爆 GPU 的显存。终极解法子词分词与 BPE 算法为了解决上述两难困境现代大模型无一例外地采用了子词分词Subword Tokenization其中最经典的是BPEByte-Pair Encoding字节对编码算法。BPE 算法的逻辑非常像拼积木它通过统计海量文本提炼出大约 3 万到 15 万个最基础的“字根”或“高频字符组合”这些组合就是Tokens。通过这种方式大模型只需要在显存中维护一个 10 万词左右的固定词表就能通过这 10 万个“积木块”拼写出世界上所有的单词且极大地缩短了计算序列的长度。在英文语料中一个普通的单词平均会被切分成1.3 个 Tokens。3. 意外的历史从“省盘空间”的压缩算法到 AI 救世主很多人以为 Token 或者是 BPE 分词算法是近几年伴随 ChatGPT 发明出来的新科技。其实它的诞生与 AI 毫无关系最初只是一个 30 年前的“省盘空间”的小发明。值得注意的是今天大模型使用的 BPE并不是直接复制1994年的压缩算法而是在其思想基础上重新设计的“子词学习算法”。1994 年的压缩备忘录BPE 算法最初由 Philip Gage 在 1994 年发表。当时电脑硬盘极小他的目的非常单纯怎么把文本文件压缩得更小。它的原理是寻找文本里最常成对出现的字符比如 he然后用一个没用过的字符比如 来代替。不断重复文件就变小了。2015 年的机器翻译救赎在 2015 年前早期的自然语言处理NLP遇到了一个死穴——“未登录词Out-Of-Vocabulary, OOV”。如果语料库里没有收录 unbelievable 这个词旧 AI 就会直接“死机”或报错。德国科学家 Rico Sennrich 突然灵光一闪能不能用 1994 年那个用来压缩文件的 BPE 算法把单词切碎成最合理的“积木块”这一跨界尝试直接奠定了现代大模型的基石。4. 技术偏见为什么中文用户在 Token 账单上“天生吃亏”了解了 BPE 算法我们就能解释一个困扰许多中文开发者的现象同样一句话在一些以英文语料为主训练的模型中中文 Token 密度确实明显高于英文过去甚至可能达到 23 倍这源于早期大模型分词器Tokenizer在训练时的英语霸权。词表分配不均由于西方主流大模型的训练语料库中英文占比超过 90%中文占比极低。分词器在自动学习高频“积木块”时词表中绝大多数位置都被英文子词占领了。汉字的“字节降级Byte Fallback”当分词器遇到词表里没有的中文汉字例如“苹”时为了防止程序报错分词器会启动“降级机制”将这个汉字强制转换成 UTF-8 编码的 3 个原始字节并用 3 个最基础的字节 Token 来表示。结果就是英文单词 apple 只占用1 个 Token而中文词汇【苹果】却要被切成【苹】、【果】 两个字甚至在某些模型里因为字节降级被切成4 至 6 个 Tokens。这也是为什么国内大模型如 Qwen、DeepSeek在研发时必须要花大力气扩展词表、重写中文 Tokenizer 的技术原因。而近年来针对中文优化的大模型已经通过扩充词表逐渐缩小这一差距。它们将词表扩大到 15 万以上把大量中文词组直接塞进词表才让中文的 Token 消耗效率追上了英文。5. 几何的魅力Token 是如何化身为高维“思想空间”的Token 如果仅仅停留在数字Token ID阶段大模型也只是一台冷冰冰的“分词机器”。真正赋予大模型“智能”和“跨语言翻译能力”的是接下来发生的一场数学跃迁——嵌入Embedding。大模型会将分词后的每个 Token ID映射为一个长达4096 维在 Llama-3 等大模型中的连续高维实数向量在那个玄妙的 4096 维几何空间里人类语言中的所有“概念”都变成了一个个坐标点。在这个空间里正在发生着惊人的几何运算① 分布假说Distributional Hypothesis大模型能够将文字精准映射到空间基于现代语言学的底层基石——分布假说由 J.R. Firth 于 1957 年提出You shall know a word by the company it keeps.字从邻居词由境造——通过一个词周围经常出现的词就能定义这个词的含义。大模型阅读了全互联网的文本它发现“苹果”和“香蕉”、“橘子”经常和“吃”、“水果”、“榨汁”等上下文Context成群结队出现。于是在训练优化过程中算法自然地将“苹果”和“香蕉”的向量坐标拉得很近。② 线性代数与向量平移Vector Analogy在 2013 年谷歌提出的Word2Vec算法中科学家首次发现了一个惊人的物理规律人类语言中的复杂语义关系如性别、时态、首都在空间里表现为平行的位移向量:其背后的数学机理是③ 为什么非得是“4096 维”避免语义纠缠人类的概念极其复杂。比如“苹果”既是一种“水果”靠近香蕉又是一家“科技公司”靠近微软还代表着“物理学史”靠近牛顿。如果是在 2 维或 3 维的低维空间中“苹果”只能被放在一个固定位置无法同时靠近这三个完全无关的区域。这会导致“语义纠缠”。在 4096 维的高维空间里人类概念不再被限制在平面的坐标系中而是被展开成一张复杂的“语义星空”。这里有4096个数学方向但它们并不是简单的标签轴。不存在某一个维度专门代表“水果”另一个维度专门代表“科技”。真正的秘密在于无数细微的语义特征被分散编码在整个空间之中。因此“苹果”这个概念可以同时靠近香蕉因为它们都是水果也可以靠近手机、芯片等科技概念因为它们共享另一组上下文关系。高维空间给予 AI 的并不是几个固定的抽屉而是一片足够辽阔的语义宇宙让一个概念能够同时拥有多个身份并在不同场景下激活不同的含义。④ 语义距离测量余弦相似度Cosine Similarity大模型为了衡量两个词的语义近不近并不关心它们在空间中的绝对直线距离因为高频词的向量通常极长会产生干扰而是使用余弦相似度来计算它们在 4096 维空间里的夹角1: 夹角为语义完全一致0: 夹角为两个词正交毫无关系-1: 夹角为语义完全相反⑤ 跨语言的空间重合大模型为什么懂翻译很多人好奇大模型没有安装专门的翻译软件它是怎么实现中英文无缝互译的答案极其浪漫在多语言模型中不同语言中表达相同概念的 Token会在训练过程中逐渐形成高度相关的表示空间。大模型通过海量语料的学习发现无论是中国人说“苹果”还是美国人说“apple”它们在现实文本里的上下文关系比如都与“红色的”、“水果”、“吃”相关是完全对称的。因此算法在训练中会自动将不同语言中代表相同概念的 Token推向同一个高维坐标。大模型在翻译时并不是机械地查字典而是在空间里找到了那个“苹果”的概念坐标然后用目标语言的 Token 把它“读出来”而已。6. 真实物理代价当你消耗 Token 时地球上实际烧掉了什么在手机或电脑屏幕上Token 只是一个闪烁的字符或一行账单数字。但在物理世界中每一个 Token 的生成都是一次对地球物理资源的实质性消耗。当你调用 API 生成 100 万个 Tokens 时底层实际上发生了以下资源的真实消耗在过去人们认为互联网和 AI 是“轻资产”的虚拟行业。但随着大模型参数量向万亿级迈进人类开始猛然醒悟大模型正在像一头庞大的物理巨兽开始与人类、农业、以及传统工业争夺地球上最宝贵的刚性资源。① 算力FLOPS与芯片磨损生成一个 Token大模型底层的数亿至数千亿个参数权重就需要与输入向量进行一次完整的矩阵乘加运算。生成 100 万个 Tokens意味着 GPU 的 Tensor Core张量核心要执行数十万亿次的浮点运算FLOPS。这伴随着电流在高集成度硅片晶体管中的高速穿梭带来芯片设备生命周期消耗和制造资源压力。全球最先进的芯片代工厂只有台积电TSMC全球最顶尖的极紫外光刻机EUV几乎全在 ASML 手里。先进晶圆产能也是一种极端稀缺的物理资源。当英伟达、超威AMD为了 AI 订单将台积电 3 纳米、2 纳米的产能席卷一空时消费级电子产品如手机、显卡、汽车芯片的产能就会被无形挤压。这种对高端硅片、光刻机产能的争夺已经上升到了国家级地缘政治的战略防线主权 AI / Sovereign AI。谁掌握了算力资源谁就掌握了下一个时代的科技霸权。② 电力数字背后的无形煤炭运行这些庞大的 GPU 服务器集群需要极为恐怖的电能。根据科研机构的研究估算向大模型发送一次简单的查询并生成一段回答约数十到上百个 Tokens所消耗的电能大约相当于点亮一盏 60 瓦的电灯泡运行几分钟。大模型对电力的饥渴正在逼迫科技巨头直接插手国家能源命脉。由于公共电网无法承受 AI 数据中心的负荷科技巨头正在绕过公共电网直接去源头“抢电”微软的核电算盘2024 年微软与美国星座能源Constellation签署了一项史无前例的 20 年购电协议促使曾经发生过严重核泄漏事故的三里岛核电站Three Mile Island重新启用只为了给微软的 AI 数据中心提供专属核电。亚马逊的举动亚马逊 AWS 直接买下了宾夕法尼亚州一个核电站旁的数据中心直接插管吸取核能。物理瓶颈AI 正在与传统制造业、居民用电争夺电网配额。在硅谷所在的加州由于数据中心用电激增已经开始出现局部电网承载力告急。PS为了解决电力困局大家也是各显神通受控核聚变终极梦想OpenAI 创始人山姆·奥特曼个人向核聚变初创公司 Helion 投资了数亿美元。Helion 计划最快在 2028 年向微软的数据中心提供核聚变电力。如果成功人类将彻底摆脱能源危机。甚至还有从需求解决问题的 光子芯片//类脑芯片 的设想③ 水AI 的“口渴”指数GPU 在高强度运算时会产生极其惊人的热量单颗英伟达 H100 芯片热功耗高达 700W。为了散热数据中心必须依赖冷却塔进行蒸发散热。加州大学河滨分校UCR的研究估算在特定数据中心条件下一次包含几十轮问答的 AI 对话其间接水消耗可能达到数百毫升量级。数据中心不是把水循环使用就行了为了带走热量大量的水是以气化蒸发的形式永远消耗掉的。目前大约90% 的数据中心外循环使用的是珍贵的“市政自来水饮用水”或地下水。这种高耗水特性正在引发严重的生态与社会冲突乌拉圭冲突谷歌计划在乌拉圭建设大型数据中心每天需要消耗数百万升淡水而当时乌拉圭正处于数十年来最严重的干旱中居民甚至没有干净的饮用水。这引发了当地民众的强烈抗议。地方法规限制在爱尔兰和荷兰由于数据中心对电网和水源的过度榨取政府已经开始限制或暂停新建数据中心。AI 已经开始和人类的生存基本资源发生“零和博弈”。PS为了彻底解决“AI 抢水”的困局半导体和化工巨头正在全力研发“液冷Liquid Cooling”技术用化学液体代替水在100% 密闭的系统里循环运行实现零水消耗。-- 氟化液、防冻液、矿物油等等“去水化”是整个 AI 算力基础设施的必然趋势④ 物理学终极定理信息即物理Information is Physical为什么 AI 摆脱不了物理资源因为物理学中有一个著名的兰道尔原理Landauers Principle在物理学中擦除或改变 1 比特bit的信息在热力学上必定会产生一个最小的能量消耗其公式为这个公式冷酷地证明了信息并不是虚无缥缈的它和物质、能量在物理学底层是统一的。只要人类想要获得更高阶的智能就必须在物理世界中消耗大量的电并散发出大量的热。7. Token 经济学为什么输出 Token 往往比输入贵 3 到 4 倍如果你看过 API 的价格表你会发现一个奇怪的现象输入InputToken 便宜而输出OutputToken 却贵得多。这涉及大模型工作时GPU 面临的两道不同的物理瓶颈输入阶段Prefill 阶段当你把一大段文字比如 1000 字发给 AI 时大模型是一次性并行Parallel读入这些 Token 的。这时候 GPU 的数万个核心可以满载全力轰鸣算力利用率极高这被称为“计算受限Compute-Bound”。输出阶段Decode 阶段大模型写出回答时是一个 Token 一个 Token 蹦出来的串行自回归。在生成第 101 个词时GPU 必须把前 100 个词作为输入把整个模型几千亿个参数从内存HBM里重新读取一遍。这种“每写一个字就要搬运一次庞大参数”的模式导致 GPU 的计算核心大部分时间在空转、等待数据搬运这被称为“内存带宽受限Memory-Bandwidth Bound”。因为输出阶段对显存带宽的极度压榨和极低的计算效率导致输出一个 Token 的硬件实际物理成本远远高于输入一个 Token。平台自然要把这笔差价转嫁给消费者。8. 终极哲学未来Token 会进化成什么在著名科技思想家梅拉妮·米歇尔的著作《AI 3.0》中曾探讨过关于“递归自我改善Recursive Self-Improvement”的思想一个能够设计 AI 的 AI理论上可以制造出更强大的 AI从而引发“智能爆炸”迈向物理与逻辑的终极边界。如果我们顺着这个思维实验往下看在未来Token 还会存在吗它会变成什么阶段 ①万物皆可 Token世界模拟器当前的 Token 已经不再局限于文字。在最新的多模态模型中图像被切成 16x16 像素的Patch图像块 Token视频被切成空间-时间连续的Sora 视频 Token机器人的动作被切成Action Token动作标记如“机械手向右旋转15度”。在未来Token 会变成大模型对物理世界进行无损压缩的“终极积木”。AI 通过拼写这些积木来模拟和重构宇宙中的万事万物。阶段 ②AI 的自我迭代与人类语言Token的消亡正如《AI 3.0》中所暗示的当 AI 能够自我设计、进行递归迭代并超越人类智慧时它们将不再需要向人类解释自己的思考过程。现在的 Token本质上是 AI 为了“向下兼容”人类脆弱的语言理解能力而做出的有损压缩和翻译。未来的 AI 之间如果进行交流将彻底抛弃低效率的文本 Token。它们会直接通过4096 维甚至上万维的高维向量Embeddings进行“直接意识对撞”瞬时传输海量复杂信息。到那时作为人类语言载体的 Token 将完成它的历史使命重新退回历史的尘埃中。而人类语言也许会成为硅基生命眼中的“低频模拟信号”。9. 总结如何巧妙优化你的 Prompt 降低成本在技术彻底超越我们之前作为普通消费者和开发者我们依然需要算好眼前的 Token 账单避免无意义的符号与冗余空格在大模型分词器眼里word、word带空格和 word! 分属完全不同的 Token。精简提示词的格式能直接省下真金白银。中文任务优选国产大模型对于重度中文应用优先选择 Qwen、DeepSeek 等拥有自主大词表分词器的模型其 Token 压缩率更高能省下大笔费用。互动环节你遇到过最离谱的 Token 扣费账单是什么当想到每一次调侃 AI、让它写废话的背后都有数百毫升的水在服务器后台悄悄蒸发你对 AI 的看法是否发生了改变欢迎在评论区留下你的硬核思考。下期预告《原来如此 | 第07期一次被封锁了 9 家实体的“寒武纪”为什么这家中国 AI 芯片巨头要用 5 亿年前的地质时代命名》

相关新闻

最新新闻

KKR方法计算磁性体系交换常数

KKR方法计算磁性体系交换常数

KKR方法计算磁性体系交换常数KKR方法计算磁性体系交换常数一、引言KKR(Korringa-Kohn-Rostoker)方法计算磁性体系交换常数,通常采用Liechtenstein–Katsnelson–Antropov–Gubanov(LKAG)公式。该方法通过自旋向上/向下…

2026/8/11 7:35:04
毫米波雷达、纯固态激光雷达,都在用的相控阵啥原理?电磁波怎么分布的?

毫米波雷达、纯固态激光雷达,都在用的相控阵啥原理?电磁波怎么分布的?

引言 毫米波雷达,如果一个收发天线,一次只能测一个距离,反射点位置所在的范围,是以发射源为圆心的球面。2天线2球面相交,范围缩小到一个圆,3天线3球面相交,范围缩小到几个点……要描绘出一个3D物…

2026/8/11 7:35:04
【Bugku】xxmmll

【Bugku】xxmmll

非预期解 直接扫到部署的docker-compose配置文件&#xff0c;拿到flag 预期解 在返回包中出现xxmmll.php 访问&#xff0c;很明显的XXE提示 输入下面内容读取flag <?xml version "1.0" encoding"utf-8"?><!DOCTYPE xxe [ <!ELEMENT name…

2026/8/11 7:35:04
C语言内存布局与动态内存管理实践指南

C语言内存布局与动态内存管理实践指南

1. C语言内存布局深度解析 在C语言开发中&#xff0c;理解内存布局是写出高效、稳定程序的关键基础。今天我们就来彻底拆解这个看似简单却暗藏玄机的话题——当你声明一个变量时&#xff0c;它究竟被放在内存的哪个位置&#xff1f;不同的存储类别又有什么区别&#xff1f; 2…

2026/8/11 7:35:04
宏裕塑胶PBT PET工程塑料的卓越性能与应用优势

宏裕塑胶PBT PET工程塑料的卓越性能与应用优势

导读&#xff1a;对于制造业企业而言&#xff0c;材料选择直接影响产品性能和成本结构&#xff0c;尤其在工程塑料领域&#xff0c;PBT与PET作为两大核心材料&#xff0c;其性能与应用优劣一直是业内关注焦点。宏裕塑胶PBT PET工程塑料的卓越性能与应用优势&#xff0c;正通过其…

2026/8/11 7:35:04
高端显卡啸叫成因与优化指南:从深度学习负载到硬件调优

高端显卡啸叫成因与优化指南:从深度学习负载到硬件调优

最近在技术社区和硬件论坛上&#xff0c;一个看似“玄学”但又非常实际的问题被反复提及&#xff1a; 高端显卡&#xff08;尤其是像5090D这样的型号&#xff09;在运行高负载任务时&#xff0c;会产生令人烦躁的“啸叫”&#xff08;Coil Whine&#xff09; 。有用户甚至形容…

2026/8/11 7:30:04