《生成式人工智能与机器学习导论 2025》第 3 讲 - 学习笔记1 《生成式人工智能与机器学习导论 2025》第 3 讲-学习笔记1. LLM生成文字的整体流程大型语言模型Large Language Model, LLM生成文本时并不是直接“理解问题并写答案”而是通过多层神经网络逐步转换表示最终预测下一个 Token。整体流程文字输入 ↓ Tokenization ↓ Token ID ↓ Embedding ↓ Transformer Layers ↓ Hidden Representation ↓ LM Head ↓ Probability Distribution ↓ 预测下一个 Token ↓ 循环生成核心思想LLM本质上是在当前上下文条件下不断计算下一个Token出现概率的模型。2. Tokenization分词2.1 为什么需要Tokenization计算机无法直接处理文字只能处理数字。因此需要把自然语言转换成模型可以计算的基本单位TokenToken可能是一个单词一个汉字一个词的一部分标点符号例如输入artificial intelligence可能转换为art ificial intelligence2.2 为什么不用完整单词如果一个词对应一个Token词汇表会非常巨大新词无法处理拼写变化难以覆盖因此现代LLM通常采用Subword Tokenization子词分割例如unbelievable可以拆成un believe able这样模型可以组合理解未见过的新词。3. Token ID数字编号Token仍然是文字神经网络无法直接处理。因此每个Token会对应一个编号例如法国 → Token ID 39872 首都 → Token ID 58291输入法国的首都是可能转换为[39872, 102, 58291, 76]注意Token ID只是编号没有数学意义。例如法国 39872 德国 56321并不表示德国比法国“大”。4. Embedding词向量表示4.1 Token ID如何变成语义Token ID只是数字。模型需要将它转换为连续向量例如法国 ↓ [0.21, -0.35, 0.67, ...]这个过程叫Embedding4.2 Embedding矩阵假设词表大小128256Hidden Size4096那么Embedding矩阵128256 × 4096每一行代表一个Token的向量。4.3 Embedding表示什么Embedding表示Token本身的语义特征例如巴黎可能包含城市概念法国相关地理信息语言关系特点静态同一个Token永远相同例如两个句子中的bankEmbedding相同。5. Transformer LayersTransformer层Embedding只是Token的初始表示。模型还需要理解上下文。例如I deposited money in the bank.和I sat on the river bank.两个bank含义不同。Transformer负责根据上下文调整Token表示。6. Transformer内部结构一个Transformer Layer主要包含Input ↓ Self-Attention ↓ Feed Forward Network ↓ Output7. Self-Attention自注意力机制Self-Attention解决当前Token应该关注哪些其他Token例如小明去银行取钱因为他需要现金。模型需要知道“他”指的是“小明”。Attention会计算Token之间的重要程度。核心计算Attention(Q,K,V)softmax(QKT/d)V Attention(Q,K,V)softmax(QK^T/\sqrt d)VAttention(Q,K,V)softmax(QKT/d​)V其中Query我需要寻找什么信息Key我有什么信息Value实际提供的信息8. Feed Forward Network前馈网络Attention负责信息交流Feed Forward负责对信息进一步加工例如输入法国 首都模型逐渐形成法国 → 国家 首都 → 城市关系 巴黎 → 可能答案9. Hidden Representation隐藏表示经过多层Transformer后Token会得到新的向量表示。例如h [ 0.32, -0.56, 0.91, ... ]这个向量称为Hidden Representation9.1 Embedding和Hidden Representation区别虽然维度通常相同例如Embedding: 4096维 Hidden Representation: 4096维但是意义不同。阶段含义EmbeddingToken自身的语义Hidden Representation结合上下文后的动态语义9.2 Hidden Representation是动态的例如Tokenbank句子1money in the bank句子2river bankEmbedding相同Transformer之后Hidden Representation不同因为上下文不同。10. Embedding维度和Hidden维度关系现代LLM通常Embedding Dimension Hidden Size例如Llama类模型4096维流程Token ↓ Embedding 4096维 ↓ Transformer 4096维 ↓ Hidden Representation 4096维原因Transformer设计为保持输入维度 输出维度11. LM Head语言模型输出层Transformer输出的是Hidden Vector例如4096维但是模型需要回答下一个Token是什么因此需要LM Head。11.1 LM Head作用LM Head将4096维Hidden State转换为128256个Token的分数数学形式zWhb zWhbzWhb其中hHidden RepresentationWLM Head权重zLogits11.2 LM Head矩阵尺寸假设Vocabulary128256Hidden Size4096则W128256×4096 W128256\times4096W128256×4096计算128256 × 4096得到128256个Logits每个Logit代表一个Token出现的可能性评分。12. Probability概率分布Logits不是概率。需要通过Softmax转换例如输入巴黎 12.5 伦敦 8.2 东京 6.7输出巴黎 92% 伦敦 5% 东京 2%形成整个词表上的概率分布。13. 预测下一个Token模型选择概率最高的Token输入法国的首都是输出巴黎得到法国的首都是巴黎14. 自回归生成Autoregressive GenerationLLM不是一次生成完整句子。而是一次预测一个Token。过程输入 ↓ 预测Token1 ↓ 加入输入 ↓ 预测Token2 ↓ 加入输入 ↓ 继续循环直到生成结束Token达到最大长度15. Weight Tying权重共享很多现代LLM会让输入Embedding矩阵和输出LM Head矩阵共享参数。目的让输入和输出使用同一个语义空间。15.1 为什么可以共享输入Token ↓ Embedding ↓ 语义向量输出Hidden State ↓ 寻找最匹配Token二者本质都是Token与语义向量之间的映射。15.2 为什么有时写WEᵀ原因是矩阵定义方向不同。方式1EmbeddingE∈R128256×4096 E \in R^{128256 \times 4096}E∈R128256×4096那么WE WEWE方式2EmbeddingE∈R4096×128256 E\in R^{4096\times128256}E∈R4096×128256那么WET WE^TWET因此转置不是核心。核心是输入Embedding和输出预测共享同一套Token语义表示。16. 完整流程总结文字输入 ↓ Tokenization 把文字切成Token ↓ Token ID 转换为数字编号 ↓ Embedding Token ID → 语义向量 ↓ Transformer Layers 通过Attention和FFN理解上下文 ↓ Hidden Representation 形成当前上下文的内部表示 ↓ LM Head Hidden Vector → 所有Token评分 ↓ Softmax 评分 → 概率 ↓ 预测Token 选择最高概率Token ↓ 循环生成核心理解大型语言模型并不是输入问题 ↓ 搜索答案 ↓ 输出答案而是输入文字 ↓ 转换为向量 ↓ 多层Transformer逐步提取上下文信息 ↓ 形成隐藏表示 ↓ 计算每个Token概率 ↓ 逐个生成文本研究LLM内部机制的关键问题就是Hidden Representation中到底编码了什么信息Transformer不同层如何形成语言理解、知识和推理能力

相关新闻

最新新闻

基于Kubelka-Munk理论与多目标优化的工业配色方案建模实战

基于Kubelka-Munk理论与多目标优化的工业配色方案建模实战

1. 赛题回顾与核心挑战解析去年华数杯数学建模B题的题目是“不透明制品最优配色方案设计”。这个题目一出来,很多同学,尤其是第一次参加建模比赛的朋友,可能会有点懵。它不像传统的优化问题那样,给你一堆明确的约束条件和目标函数…

2026/8/27 20:23:42
移动场景超分辨定位:从MUSIC/ESPRIT算法到运动补偿的工程实践

移动场景超分辨定位:从MUSIC/ESPRIT算法到运动补偿的工程实践

1. 项目概述:从一道赛题到一套完整的工程化解决方案 拿到“2022年全国研究生数学建模竞赛华为杯A题移动场景超分辨定位问题”这个标题,很多参加过数模竞赛的朋友可能会心一笑,这背后是一段充满挑战与收获的回忆。这道题目的核心,是…

2026/8/27 20:23:42
Apache Airflow调度系统实战:从DAG到分布式工作流

Apache Airflow调度系统实战:从DAG到分布式工作流

第一次打开 Airflow 的 Web UI,绝大多数人的注意力都会停在 Graph View 那张五颜六色的图上。绿色代表任务成功,红色代表失败,蓝色代表运行中,灰色代表排队等待,还有被跳过、被上游阻断等特殊状态。很多人第一眼会觉得…

2026/8/27 20:23:42
FPGA/GPU多路供电怎么配?多通道可编程直流电源选型指南

FPGA/GPU多路供电怎么配?多通道可编程直流电源选型指南

FPGA和GPU是很多电子系统的”大脑”,但给它们供电是件麻烦事:一路3.3V、一路1.8V、一路0.85V核心电压,加上严格的上电顺序和毫秒级的电流突变,普通单路电源根本顶不住。这篇文章从选型角度讲清楚四件事:多通道电源的通…

2026/8/27 20:23:42
鲁棒相位解包裹算法工程实现:从质量图引导到约束最小二乘

鲁棒相位解包裹算法工程实现:从质量图引导到约束最小二乘

1. 项目概述:从一篇论文到一套可复现的工程方案 最近在做一个涉及光学干涉测量的项目,核心难点之一就是相位解包裹。这个环节要是处理不好,前面所有精密的干涉条纹分析都白搭。在翻找文献时,我看到了这篇发表在《Optics Express》…

2026/8/27 20:23:42
玻璃温室微气候调控:温度湿度CO₂气流四维协同规则

玻璃温室微气候调控:温度湿度CO₂气流四维协同规则

1. 什么是玻璃温室里的微气候规则?它到底管什么? “玻璃温室中的微气候规则”——这名字听起来像农业气象学的论文标题,但其实它是一套在真实生产场景里天天被种植户、园艺师、设施农业工程师反复调校、验证、推翻又重建的操作逻辑。它不是写…

2026/8/27 20:18:36