Kimi K3权重上线魔乐社区!基于昇腾的推理部署指南来了 Kimi K3全球首个开源的 3 万亿级别 MoE 模型昇腾 Day0 适配原生视觉理解 百万 token 上下文 关键Infra技术全面开放。2026 年 7 月 27 日月之暗面正式开源 Kimi K3的模型权重以及支撑 Kimi K3 模型训练的关键 Infra 技术MoonEP、FlashKDA 和 AgentEnv。Kimi K3是一个拥有2.8 万亿参数的混合专家MoE模型具备原生视觉理解能力并支持 100 万 token 的上下文窗口。它是全球首个开源的 3 万亿级别模型面向长程编程、知识工作和推理等前沿智能场景而设计。Kimi K3 的开源模型权重和NPU适配的量化权重均已上线魔乐社区欢迎广大开发者下载下载地址模型原始权重https://modelers.cn/models/moonshotai/Kimi-K3量化权重(NPU适配https://modelers.cn/models/Eco-Tech/Kimi-K3-w4a81. 技术报告与关键 Infra 技术同步公开Kimi K3 参数规模是 Kimi K2.5 的3 倍左右但规模化并不仅仅是参数的堆叠。在并不宽裕的算力条件下Kimi K3 凭借Kimi Delta Attention、Attention Residuals 以及 MoonEP等一系列技术创新规模化效率提升了2.5 倍即在算力最优意义下单位算力产出智能约等于原来 2.5 倍。与 Kimi K3 模型权重一起公开的还有 Kimi K3 的技术报告以及支撑训练的三项 Infra 技术MoonEP、FlashKDA 和 AgentEnv覆盖从高性能通信、高性能算子到分布式 RL 环境的关键链路。其中 FlashKDA 此前已开源MoonEP 和 AgentEnv 则随本次发布正式开源。MoonEPMoonEP 是 Kimi 团队为超大的细粒度 MoE 打造的高性能通信库让专家并行expert-parallel的通信在不均衡的情况下仍然实现极致效率。FlashKDAFlashKDA 是 Kimi 团队实现的 Kimi Delta Attention 高性能算子。在英伟达 H20 上相比 flash-linear-attention 基线它的prefill 速度提升 1.72–2.22 倍可以直接作为 flash-linear-attention 的替换后端。AgentEnvAgentEnv 是 Kimi 团队与 KVCache.ai 合作开发的沙箱系统用于大规模运行 Agent 环境。它为 Kimi K3 的后训练提供高保真、强隔离沙箱灵活支持快速快照、恢复和分叉fork等可应对大规模并行的 Agent 工作流与训练任务。2. 昇腾实现 Day0 适配此次 Kimi K3 一经开源发布昇腾即实现 Day0 适配在训练侧基于 MindSpeed MM 在 Atlas 800 A3、Atlas 900 A3 SuperPoD 上完成减层训练基础功能适配在算子、并行加速、显存优化等方面进行专项优化在推理侧通过 vLLM Ascend 与 SGLang 开源推理引擎实现快速部署同时昇腾 950 超节点支持 FP8、MXFP8、MXFP4 等全系列数值精度格式原生支持 Kimi K3 的 mxFP4 量化权重。Kimi K3 接入 vLLM Ascend / SGLang 后用户仍可沿用 vLLM / SGLang 的服务接口、调度方式和参数体系。vLLM Ascend 支持 Prefix Cache、Chunked Prefill、异步调度、PD 分离和内存池化等能力在适配 KDA、Gated MLA 和 LatentMoE 新结构的同时保持这些框架能力与使用方式不变使 K3 能够无缝进入现有 vLLM 推理服务体系。融合算子加速: KDA Prefill 与 Decode 双路径KDA 状态具有严格的时序依赖vLLM Ascend 针对 Prefill 和 Decode 为 Kimi K3 设计了两条执行路径Prefill 以 64 Token 为 Chunk将 QK 归一化、Gate 累积和 Chunk KDA 组织为批量计算Decode MTP 则直接在状态池上执行短序列递归更新。Decode 路径使用Ascend C 融合 Kernel在单次执行中完成 QK L2Norm、Gate 与 Beta 处理、状态衰减、Delta Rule、外积更新、输出计算和 Final State 原地回写。V×K 工作状态驻留 Unified Buffer并按“逻辑序列 × Value Head”并行分配任务从而减少多算子启动、临时 Workspace、全局内存往返和阶段间同步开销。MoE 通算: MC2 支撑 896 专家与大规模 EPKimi K3 在部署时EP64 下每张卡只有 14 个路由专家而每个 Token 要访问 16 个专家跨 Rank 交换是必然动作。vLLM Ascend 通过 MC2 将路由后的 Token 重排、跨 Rank 分发、局部专家计算和结果回收组织为一条设备侧流水线避免 CPU 参与热路径调度。MC2 路径在 Dispatch 前、GMM2 前与 Combine 前记录 Stream Event使 Shared Expert 可以在独立 Stream 中与路由专家、通信阶段重叠。Token 分发、专家 GMM 与结果回收因此可以在设备侧连续推进减少 CPU 介入和阶段间等待。原生量化: MXFP4 权重与逐 Token 动态 MXFP8 激活Kimi K3 以 MXFP4 承载专家权重、以 MXFP8 承载专家计算激活。vLLM Ascend 通过 ModelSlim 量化配置直接加载原生量化权重并在设备侧执行逐 Token 动态 MX 量化、生成 Per-Token Scale量化结果与 Scale 随 Token 一同进入专家分发和 Grouped MatMul减少权重与激活的存储、访存及中间搬运开销。量化范围按模块控制Router 保持高精度发布版权重中的 LatentMoE 降维、升维投影保持 BF16ModelSlim 原生权重则可对其独立量化。第一层专家计算后的激活与 MXFP8 量化融合再直接进入第二层矩阵计算在兼顾关键模块精度的同时减少独立量化 Kernel 和阶段间同步。并行布局优化: FlashComm1 降低冗余计算vLLM Ascend 针对 K3 多模态输入从全局 Embedding 切换到 TP 分片布局的特点对 FlashComm1 执行路径进行了模型级适配。vLLM Ascend 将布局转换前移到第一层解码器边界一次完成Token 分片和通信编排后续 KDA / MLA 仅在确实需要完整序列的位置集中执行 All-Gather避免多次数据收集及其带来的冗余处理。同时vLLM Ascend 进一步打通 FlashComm1 与 Shared Expert DP、TP Shard 的布局语义使视觉、注意力和专家计算沿用一致的分片方式减少中间张量搬运和多种并行策略组合下的同步开销。投机推理: SGLang 支持 DSpark 投机推理能力SGLang 在继承原有特性外与 SGL 社区同步发布 Kimi K3 DSpark 投机推理能力。DSpark 算法在一个月前正式公开亮相通过分层草稿生成降低自回归推理单次生成开销。本次 SGLang 在 Kimi K3 Day0 支持中创新性引入该算法解决模型没有原生投机权重的问题全面提升昇腾上 decode 阶段的推理性能至 TPOT 50ms。3. Kimi K3 推理部署指导用户及开发者可访问以下链接获取 Kimi K3 基于昇腾的部署指导vLLM Ascendhttps://docs.vllm.ai/projects/ascend/en/v0.23.0/tutorials/models/Kimi-K3.htmlSGLanghttps://github.com/sgl-project/sglang/issues/32519欢迎体验无论你是高校科研人员、AI 算法工程师还是开源大模型爱好者都可以前往魔乐社区一键获取 Kimi K3 完整开源权重。除了下载与体验我们也欢迎你在社区分享部署实践、性能测试、量化方案和调优经验交流 Kimi K3 的微调方法、国产算力适配心得及行业落地案例与更多开发者共同推动国产大模型与国产算力生态繁荣发展。立即前往魔乐社区获取 Kimi K3 完整开源权重https://modelers.cn/models/moonshotai/Kimi-K3https://modelers.cn/models/Eco-Tech/Kimi-K3-w4a8

相关新闻

最新新闻

Glean预计算索引:解决MCP上下文碎片化问题的工程实践

Glean预计算索引:解决MCP上下文碎片化问题的工程实践

在 AI 应用开发领域,上下文窗口的有效利用一直是决定模型性能的关键因素之一。当处理长文档、代码库或复杂知识库时,传统的检索增强生成(RAG)系统经常面临上下文碎片化问题——模型无法看到完整的关联信息,导致回答不连…

2026/7/30 15:46:20
前端轻量化框架Lit与Alpine.js实战解析

前端轻量化框架Lit与Alpine.js实战解析

1. 前端轻量化趋势的兴起 去年我在重构一个遗留项目时,遇到了一个典型场景:这个基于React的企业后台系统,打包体积达到了惊人的8MB,首屏加载时间超过5秒。当我尝试用Chrome的Coverage工具分析时,发现实际用到的代码不到…

2026/7/30 15:46:20
字符串算法实战:滑动窗口与动态规划解决面试压轴题

字符串算法实战:滑动窗口与动态规划解决面试压轴题

在实际编程面试和算法考试中,字符串处理类题目往往因为其看似简单、变化多端而成为许多人的痛点。很多人以为字符串题只是简单的拼接、截取或查找,但真正拉开差距的往往是那些需要综合运用数据结构、算法思想和边界处理的程序压轴题。这类题目不仅考察基…

2026/7/30 15:46:20
magnetW:一站式磁力链接聚合搜索的终极解决方案

magnetW:一站式磁力链接聚合搜索的终极解决方案

magnetW:一站式磁力链接聚合搜索的终极解决方案 【免费下载链接】magnetW [已失效,不再维护] 项目地址: https://gitcode.com/gh_mirrors/ma/magnetW 在数字资源获取的海洋中,如何快速找到高质量的磁力链接一直是技术爱好者和普通用户…

2026/7/30 15:46:20
终极免费解锁:3步实现Wand专业版完整功能永久使用

终极免费解锁:3步实现Wand专业版完整功能永久使用

终极免费解锁:3步实现Wand专业版完整功能永久使用 【免费下载链接】Wand-Enhancer Advanced UX and interoperability extension for Wand (WeMod) app 项目地址: https://gitcode.com/GitHub_Trending/we/Wand-Enhancer 还在为Wand(原WeMod&…

2026/7/30 15:46:20
Node.js 安装与配置全攻略:从零搭建稳定开发环境

Node.js 安装与配置全攻略:从零搭建稳定开发环境

1. 项目概述:为什么Node.js的安装值得你花时间 如果你刚开始接触Web开发,或者想从后端Java、PHP转向更现代的JavaScript全栈,那么Node.js绝对是你绕不开的第一道坎。很多人觉得“安装”不就是点下一步吗?但恰恰是这一步&#xff0…

2026/7/30 15:41:20

月新闻