Nano-VLLM全代码解析笔记(9)-qwen3.5介绍 前言Nano-VLLM的全代码以及MOE改造均已完成从上一篇的笔记可以看出Nano-VLLM这个项目是存在瓶颈的很多实现都比较粗糙对模型的高效支持也仅限全注意力的稠密架构文本模型。接下来的章节是对Nano-VLLM的魔改以支持Qwen3.5-0.8B混合注意力MTP视觉编码器主要参考代码为VLLM源码和Transformers源码本节简单介绍Qwen3.5-0.8B它与Qwen3-0.6B的区别以及接下来需要改造的地方本节参考资料Qwen3.5技术报告(49 封私信) Qwen3.5技术报告解读 - 知乎(49 封私信) Qwen3.5 架构最全拆解Linear Attention 源码配图解析、Gated DeltaRule 公式源码逻辑介绍、Full Attention与 MoE 模块算子流程解析 - 知乎TODO LIST已完成Qwen3.5架构介绍正在完成新的MRoPE支持的全注意力层待完成GDN线性注意力层待完成多模态支持视觉塔/多模态预处理/多模态条件生成类/权重加载待完成引擎LLMEngine/Sequence/Scheduler/ModelRunner修改待完成MTP支持待完成流式输出与多请求支持Qwen3.5架构介绍Qwen3.5相比于Qwen3的核心区别在于混合注意力架构原来的全注意力层变成了三层线性注意力加一层全注意力层和MoE架构大幅降低了计算成本约50%。同时加入了MTPMulti-Token Prediction和视觉编码器同时对RMSNorm进行了调整yx/RMS(x)​×γ变为了yx/RMS(x)​×(γ1)。以下是两代模型的架构图Qwen3.5这里只放了文本模型的架构视觉特征是经过Qwen3_VIT得到再输入模型的需要额外的模型支持Qwen3-0.6B(图来自知乎北方的郎)Nano-VLLM要改造的地方首先让我们回顾一下Nano-VLLM的文件架构仓库架构为了适配Qwen3.5-0.8B混合注意力MTP视觉编码器我们需要做的改变有按接下来的代码讲解顺序1.(layers)新的MRoPE支持的全注意力层2.(layers)GDN线性注意力层3.(layers)多模态支持4.(engine)引擎适配模型5.(models)MTP支持接下来是代码魔改与讲解完成的可能比较慢敬请期待。本系列文章(待写完修正)[1]Nano-VLLM全代码解析笔记(1)-sequence[2]Nano-VLLM全代码解析笔记(2)-block_manager[3]Nano-VLLM全代码解析笔记(3)-llm_engine和scheduler[4]Nano-VLLM全代码解析笔记(4)-model_runner[5]Nano-VLLM全代码解析笔记(5)-laynorm和attention[6]Nano-VLLM全代码解析笔记(6)-embed_head和linear[7]Nano-VLLM全代码解析笔记(7)-rotary_embedding[8]Nano-VLLM全代码解析笔记(8)-qwen3与qwen3_moe上一篇[8]Nano-VLLM全代码解析笔记(8)-qwen3与qwen3_moe

相关新闻

最新新闻

Qt自绘双对数坐标图:从坐标映射到LLC增益曲线实战

Qt自绘双对数坐标图:从坐标映射到LLC增益曲线实战

简介:本资源是一套面向C# WinForms开发者的双对数坐标折线图自绘控件实现,专为需要在科学计算、工程绘图或数据分析中展示宽动态范围数据的开发者设计,解决标准Chart控件不支持灵活双对数坐标的痛点。压缩包共28个文件,含8个核心C…

2026/8/30 6:13:03
xPress并行细化:突破扩散模型草稿器推理加速瓶颈

xPress并行细化:突破扩散模型草稿器推理加速瓶颈

当我们讨论大模型推理加速时,绕不开的一个思路就是“用一个更小更快的模型先写草稿,再用大模型验证”,也就是推测解码(Speculative Decoding)。这套方案在自回归模型上已经非常成熟,但当草稿模型变成扩散模…

2026/8/30 6:13:03
滴滴支付团队三轮面试复盘:支付系统设计与稳定性保障的关键考点

滴滴支付团队三轮面试复盘:支付系统设计与稳定性保障的关键考点

最近面完了滴滴支付团队的一二三轮社招,5年Java后端经验,方向是支付清结算。整体感受是:面试题量扎实、技术深度够、面试官专业度非常高,但结果有些意难平,最后没有拿到offer。原本不打算写面经,但复盘了两…

2026/8/30 6:13:03
本地开源AI生图+视频一体化:从安装包误区到工作流落地

本地开源AI生图+视频一体化:从安装包误区到工作流落地

最近总能在各路内容里看到这类标题:八月份本地AI真神、开源生图视频一体化方案、效果硬刚即梦2.5、安装包在此。点进去一看,有的确实在认真分享流程,有一部分则是把“本地部署”包装成了“下载一个安装包就能搞定”的错觉。作为把 ComfyUI 从…

2026/8/30 6:13:03
CMuon优化器:用分块动量正交化解决DiT训练收敛慢与不稳定

CMuon优化器:用分块动量正交化解决DiT训练收敛慢与不稳定

先把结论放在前面:CMuon 是一个面向 Diffusion Transformer(DiT)训练的优化器改进方案,核心思路是分块动量正交化(Chunked Momentum Orthogonalization)。它要解决的是 DiT 训练里最常见的两个痛点&#xf…

2026/8/30 6:13:03
光速被重定义为四参量动态状态函数:SH9框架的通俗完整阐述(世毫九实验室原创研究)

光速被重定义为四参量动态状态函数:SH9框架的通俗完整阐述(世毫九实验室原创研究)

光速被重定义为四参量动态状态函数:SH9框架的通俗完整阐述 作者:方见华 单位:世毫九实验室 前置关键说明:这一结论并非爱因斯坦广义相对论或标准粒子物理模型的现有结论,而是由「世毫九(SH9)自指…

2026/8/30 6:08:03