[论文笔记] mixSGA HMoE BrownoutMoE 三篇 MoE 相关论文对比梳理三篇论文分别从注意力层 KV 缓存优化、异构专家架构设计、MoE 线上推理服务部署优化三个不同维度对混合专家模型做创新下面分别解析核心思想、创新点、差异对比。1. Mixture of Weight‑shared Heterogeneous Group Attention Experts for Dynamic Token‑wise KV OptimizationEMNLP 2025mixSGA基于共享权重的异构组注意力专家混合模型用于动态逐令牌键值优化问题背景大模型推理 KV 缓存占用内存巨大GQA 等静态分组 KV 方案采用固定分组粒度无法适配不同 token 的重要程度要么丢弃低优先级 token要么统一粗粒度分组造成性能损失。核心方案 mixSGA把 MoE 思想应用到注意力模块不是 FFN 专家构建一组异构分组注意力专家各个专家拥有不同 KV 分组大小。逐 token 专家选择路由依据学习得到 token 重要性分数把不同 token 路由到不同 KV 粒度的注意力专家保留全部 token不做丢弃重要 token 分配细粒度 KV普通 token 分配粗粒度 KV。专家之间权重共享注意力投影层权重共享控制参数量开销。辅助损失函数约束路由接近 one‑hot保证训练、推理行为一致。实验效果在相同 KV 缓存预算下Llama3、OPT、Gemma2 等模型上指令微调、继续预训练任务获得更低困惑度、更高 ROUGE‑L降低 KV 内存占用优化注意力计算开销。定位注意力层架构创新解决 KV Cache 内存瓶颈。2. HMoE: Heterogeneous Mixture of Experts for Language Modeling用于语言建模的异构专家混合模型问题背景传统 MoE 全部使用同尺寸专家但输入 token 语义复杂度差异巨大简单 token 和复杂 token 需要的模型容量不一样同构专家很难适配不同难度样本参数利用效率低。核心方案 HMoEFFN 专家采用异构尺寸专家网络大小各不相同具备不同模型容量。支持 Top‑K固定激活专家数量、Top‑P动态自适应激活专家数量两种路由复杂 token 分配到大容量专家简单 token 分配小容量专家。专门设计训练损失提升小专家被激活概率缓解异构专家带来的激活负载不均衡。实验效果同等激活参数量下相比传统同构 MoE 获得更好语言建模性能同等性能下降低计算 FLOPs。定位Transformer FFN 层架构创新改变专家本身网络大小异构专家原生模型架构。3. BrownoutMoE: Structure‑Aware Expert Grouping for Efficient and Accurate LLM Web‑based ServicesarXiv:2607.04164面向结构感知的专家分组实现高效且准确的基于 Web 的 LLM 服务arXiv问题背景MoE 在线 Web 服务存在专家访问严重倾斜少量热专家处理绝大多数 token大量冷专家极少被调用GPU 利用率低。之前 BrownoutServe 采用按索引顺序简单合并专家为联合专家 (united expert)会把行为差异大专家合并蒸馏后精度损失大。核心方案 BrownoutMoE面向线上推理服务系统优化离线对原始专家做分组合并蒸馏在线做 SLO 感知动态降载brownout 降压保供范式。将分层专家分组建模为离散策略优化问题使用GRPO 强化学习搜索最优分组初始化依靠专家输出相似度层次聚类优先把行为相似专家划分同一组。两阶段流水线GRPO 搜索分组策略 → 分组一致知识蒸馏得到可部署联合专家模型。控制平面 SLO 感知延迟控制器线上根据 P90 延迟动态调整阈值冷专家 token 可路由到蒸馏后的联合专家牺牲少量精度保障响应时延 SLO。实验效果对比顺序分组基线精度退化最高减少 71.4%吞吐最高提升 2.24×基于 Qwen1.5‑MoE‑A2.7B 验证。定位MoE 推理服务系统优化不修改原生 MoE 网络结构后处理方式对已有训练完成 MoE 模型做专家合并蒸馏面向 Web 线上部署。三篇论文关键差异总表表格论文优化对象创新层面是否修改原生模型架构核心技术目标收益mixSGAAttention 注意力层 KV 缓存模型架构✅修改注意力模块异构分组注意力专家、token‑wise 路由、权重共享降低 KV Cache 内存开销HMoEFFN 专家网络模型架构✅修改 FFN 专家尺寸大小异构 FFN 专家、异构路由损失提升参数利用率、降低 FLOPsBrownoutMoEMoE 推理部署服务系统 后训练蒸馏❌不改动原生模型离线做专家合并蒸馏GRPO 专家分组搜索、联合专家蒸馏、SLO‑aware brownout 控制提升线上推理吞吐保障服务时延 SLO控制精度损失补充区分要点mixSGA 把 MoE 思想迁移到注意力HMoE、BrownoutMoE 聚焦传统 FFN MoEHMoE 是训练阶段原生异构专家架构BrownoutMoE 是对已经训练好的 MoE 做后处理属于服务侧优化BrownoutMoE 继承 BrownoutServe 的联合专家与 brownout 降载思想解决它顺序分组带来精度损失的短板。

相关新闻

最新新闻

【案例说明】融合知识图谱、大语言模型和 AI Agent 完成能源领域知识工程工作

【案例说明】融合知识图谱、大语言模型和 AI Agent 完成能源领域知识工程工作

关于知识工程,前面写过【新手上路常见问答】关于知识工程-CSDN博客从知识到智慧:知识图谱还要走多远?_cayley 知识图谱-CSDN博客【学习资源】知识图谱与大语言模型融合_oneke知识图谱-CSDN博客随着技术的快速发展,知识工程的实现有…

2026/8/25 14:19:43
SAP Cloud Connector 到底解决了什么问题,从安全隧道到身份传递,理解 SAP 混合架构的关键连接层

SAP Cloud Connector 到底解决了什么问题,从安全隧道到身份传递,理解 SAP 混合架构的关键连接层

一家企业已经运行了很多年的 SAP S/4HANA、SAP ERP 或 SAP BW 系统,核心业务数据仍然留在企业内网。新的应用却越来越多地部署在 SAP BTP 上,可能是 CAP 应用,也可能是 SAP Integration Suite、SAP Build Work Zone、SAP Datasphere,甚至是 SAP BTP ABAP Environment。 此…

2026/8/25 14:19:43
C:\Users\<user id>\.claude\projects 到底是什么,Claude Code 为什么会在这里保存大量文件

C:\Users\<user id>\.claude\projects 到底是什么,Claude Code 为什么会在这里保存大量文件

在 Windows 上使用 Claude Code 一段时间以后,我们很容易在用户目录里发现这样一个位置,C:\Users\<user id>\.claude\projects。有时里面只有几个目录,有时却会出现几十个甚至上百个名称很奇怪的目录,再往里面看,还能找到大量 .jsonl 文件、memory 文件夹、以 UUID …

2026/8/25 14:19:43
电动车租车系统商家端怎么配置?2026 年 40+ 运营参数模块设计详

电动车租车系统商家端怎么配置?2026 年 40+ 运营参数模块设计详

商家系统配置模块要解决什么问题&#xff1f; 分时租车业务为什么需要参数化配置 分时租车平台的日常运营涉及车辆调度、电量管理、服务区管控、押金退款、报警通知等多个业务域&#xff0c;每个域都存在大量可调参数。如果这些参数硬编码在代码中&#xff0c;每次调整都需要发…

2026/8/25 14:19:43
bindFramebuffer

bindFramebuffer

代码里两处 bindFramebuffer 分别干什么先把代码里两处关键位置摘出来&#xff1a;第一处&#xff1a;初始化阶段&#xff0c;构建 FBOconst fbo gl.createFramebuffer(); const pickTex gl.createTexture(); gl.bindTexture(gl.TEXTURE_2D, pickTex); gl.texImage2D(gl.TEXT…

2026/8/25 14:19:43
WRC上听了三小时!越发感觉具身的ChatGPT时刻正在逼近。

WRC上听了三小时!越发感觉具身的ChatGPT时刻正在逼近。

19号WRC第一天&#xff0c;就去各种探展。 当天下午&#xff0c;银河通用举办了一场叫“具身智能大模型的进化之路”的论坛。 现场来的嘉宾很重磅&#xff0c;有银河通用创始人王鹤、王晓刚&#xff08;大晓机器人&#xff09;、王仲远&#xff08;北京智源人工智能研究院院长…

2026/8/25 14:14:43