复现AMD官方基准:Kimi-K2.5-Eagle3-FP8的vllm bench serve吞吐测试完整教程 复现AMD官方基准Kimi-K2.5-Eagle3-FP8的vllm bench serve吞吐测试完整教程【免费下载链接】Kimi-K2.5-Eagle3-FP8项目地址: https://ai.gitcode.com/hf_mirrors/amd/Kimi-K2.5-Eagle3-FP8想亲手复现 AMD 官方公布的 Kimi-K2.5-Eagle3-FP8 吞吐测试结果吗本文是一份面向初学者的完整教程带你用vllm bench serve在 AMD Instinct MI355X 上跑通投机解码Speculative Decoding吞吐基准一步步还原官方报告中无投机解码 vs BF16 Eagle3 vs FP8 Eagle3的完整对比数据。Kimi-K2.5-Eagle3-FP8 是 AMD 用 Quark 工具链对 lightseekorg/kimi-k2.5-eagle3里给出了官方基准在 ISL/OSL 1K/1K、TP4 的单节点 MI355X 上FP8 草稿模型相比无投机基线最高可达2.00x 加速。下面我们一步步复现它。一、为什么要复现这个吞吐测试官方数据亮点速览先看看 README 中的官方吞吐表tok/s/GPU并发数无投机 (tok/s/GPU)BF16 Eagle3FP8 Eagle3482.7157.0 (1.90x)165.2 (2.00x)8142.2269.1 (1.89x)270.1 (1.90x)16220.5399.6 (1.81x)412.7 (1.87x)32342.2627.6 (1.83x)633.8 (1.85x)64533.3901.6 (1.69x)936.6 (1.76x)复现这套数据能验证你的推理栈配置是否正确也能直观感受 FP8 量化 投机解码带来的真实收益。二、复现前的环境准备清单硬件与软件要求GPUAMD Instinct MI355X官方数据基于单节点 4 卡 TP4ROCm7.0.0PyTorch2.9.0推理引擎vLLMROCM 版本模型目标模型、BF16 草稿、FP8 草稿本仓库三者缺一不可快速获取模型文件克隆本仓库即可得到 FP8 草稿模型约 5.68 GB权重清单见 model.safetensors.index.jsongit clone https://gitcode.com/hf_mirrors/amd/Kimi-K2.5-Eagle3-FP8三、启动 vLLM 服务官方 Docker 镜像与关键环境变量使用官方指定镜像启动容器docker run -it --rm \ --device /dev/kfd --device /dev/dri --group-add video \ --ipc host --shm-size 16g --network host \ vllm/vllm-openai-rocm:nightly-fb1ac806c55a6dc96fe92261b80c8550e9c39d2f \ bash设置四个关键环境变量进入容器后务必按顺序导出export VLLM_ROCM_USE_AITER1 export VLLM_ROCM_USE_AITER_FP4_ASM_GEMM1 # 目标 MXFP4 走 FP4 ASM GEMM export VLLM_ROCM_QUICK_REDUCE_QUANTIZATIONINT4 export VLLM_ROCM_USE_AITER_RMSNORM0 # TP 8 时必须关闭 小提示如果跳过这些变量FP8 草稿路径和 MXFP4 目标的 GEMM 内核选择就会变化吞吐结果会和官方数据不一致。四、vllm serve 启动命令详解FP8 草稿配置以下命令对应官方 TP4、ISL/OSL 1K/1K 的基准配置vllm serve amd/Kimi-K2.5-MXFP4 \ --port 8888 \ --tensor-parallel-size 4 \ --gpu-memory-utilization 0.90 \ --max-model-len 2304 \ --no-enable-prefix-caching \ --trust-remote-code \ --mm-encoder-tp-mode data \ --speculative-config {model:amd/Kimi-K2.5-Eagle3-FP8,method:eagle3,num_speculative_tokens:6,draft_tensor_parallel_size:1}参数逐个说--tensor-parallel-size 44 卡张量并行--speculative-config核心指定草稿模型为amd/Kimi-K2.5-Eagle3-FP8方法eagle3投机 token 数 6--max-model-len 23041K 输入 1K 输出 余量⚠️ 对比组注意BF16 草稿基线请改用镜像vllm/vllm-openai-rocm:v0.19.0、--max-model-len 2248并把 speculative config 中的模型换成 BF16 草稿无投机基线则直接去掉--speculative-config参数。五、vllm bench serve 吞吐测试命令并发扫描服务起来后在另一个终端执行官方并发扫描C ∈ {4, 8, 16, 32, 64}for C in 4 8 16 32 64; do vllm bench serve \ --model amd/Kimi-K2.5-MXFP4 \ --backend vllm \ --dataset-name random \ --random-input-len 1024 \ --random-output-len 1024 \ --random-range-ratio 0.8 \ --num-prompts $((C * 10)) \ --max-concurrency $C \ --request-rate inf \ --ignore-eos \ --use-chat-template \ --trust-remote-code done关键参数解读--random-range-ratio 0.8输入输出长度围绕 1K 目标随机采样--ignore-eos强制每个请求输出完整采样长度保证吞吐统计公平--request-rate inf打满压测测上限--num-prompts每个并发档位 10 个请求六、读懂结果与对比验证吞吐如何计算官方口径是总吞吐 ÷ 4 张卡 tok/s/GPU括号内加速比 相对同并发无投机基线的倍数。复现后的判断标准无投机基线应与官方 82.7~533.3 tok/s/GPU 接近FP8 草稿在并发 4 时约 165 tok/s/GPU≈2.00x高并发 64 时约 936 tok/s/GPU≈1.76xFP8 在所有并发下都应 ≥ BF16 草稿七、常见坑与排查建议现象排查方向加速比异常低检查四个环境变量是否生效启动报错确认 config.json 中 exclude 为正则格式re:.*fc.*与re:.*lm_head.*本仓库已配置好见 config.json结果比官方低 20%确认 TP4、--mm-encoder-tp-mode data、关闭 prefix caching精度下降明显注意本模型 LM Head 未量化见 model-00002-of-00002.safetensors属预期设计八、总结Kimi-K2.5-Eagle3-FP8 让 Kimi-K2.5 的投机解码吞吐最高提升 2 倍而这份教程中的 Docker 镜像、环境变量、vllm serve与vllm bench serve命令就是复现官方基准的完整配方。跑通一遍你不仅验证了模型也掌握了 vLLM ROCm 栈上投机解码压测的标准姿势。想深入源码量化配置见 config.json模型实现可参考 modeling_deepseek.py 与 modeling_kimi_k25.py。动手跑起来吧【免费下载链接】Kimi-K2.5-Eagle3-FP8项目地址: https://ai.gitcode.com/hf_mirrors/amd/Kimi-K2.5-Eagle3-FP8创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

evil-surround 基础用法全攻略:ys、cs、ds 三大环绕命令实战详解

evil-surround 基础用法全攻略:ys、cs、ds 三大环绕命令实战详解

evil-surround 基础用法全攻略:ys、cs、ds 三大环绕命令实战详解 【免费下载链接】evil-surround you will be surrounded (surround.vim for evil, the extensible vi layer) 项目地址: https://gitcode.com/gh_mirrors/ev/evil-surround evil-surround 是 …

2026/8/17 23:27:02
面向受监管环境的LLM智能体安全架构:赋能与控险的平衡之道

面向受监管环境的LLM智能体安全架构:赋能与控险的平衡之道

1. 项目概述:当大模型智能体遇上受监管的网络安全运营最近和几个在大型金融机构和云服务商做安全运营中心(SOC)的朋友聊天,大家不约而同地都在头疼同一个问题:看着市面上各种基于大语言模型(LLM&#xff09…

2026/8/17 23:27:02
基于Token-Level能量分析解决强化学习动作瓶颈的实践指南

基于Token-Level能量分析解决强化学习动作瓶颈的实践指南

1. 项目概述:当智能体“卡顿”时,我们如何从微观能量视角破局?在强化学习(Reinforcement Learning, RL)的实战中,尤其是在处理序列决策任务时,我们常常会遇到一个令人头疼的现象:智能…

2026/8/17 23:27:02
apex/gateway 快速入门:10 分钟在 AWS Lambda 上运行你的第一个 Go 无服务器应用

apex/gateway 快速入门:10 分钟在 AWS Lambda 上运行你的第一个 Go 无服务器应用

apex/gateway 快速入门:10 分钟在 AWS Lambda 上运行你的第一个 Go 无服务器应用 【免费下载链接】gateway Drop-in replacement for Go net/http when running in AWS Lambda & API Gateway 项目地址: https://gitcode.com/gh_mirrors/gateway9/gateway …

2026/8/17 23:27:01
零基础体验Kiwi在线Demo:30秒看懂韩语词性标注全过程

零基础体验Kiwi在线Demo:30秒看懂韩语词性标注全过程

零基础体验Kiwi在线Demo:30秒看懂韩语词性标注全过程 【免费下载链接】Kiwi Kiwi(지능형 한국어 형태소 분석기) 项目地址: https://gitcode.com/gh_mirrors/kiwi1/Kiwi 想学韩语却总被复杂的词性分析劝退?本文为你带来韩语形态素分析器 Kiwi 的在…

2026/8/17 23:27:01
DSH 开源 42 小时 10 万星:Flask、Redis 作者点赞,与一场更大的「Agent 入口」棋局

DSH 开源 42 小时 10 万星:Flask、Redis 作者点赞,与一场更大的「Agent 入口」棋局

古董级程序员,从大厂到创业公司,现在还在一线做 AI 相关开发。微信公众号「字与码」会继续更新工程实践、新技术判断,以及这些年踩过的坑。文章若对你有用,欢迎顺手关注。 DeepSeek Harness(dsh)开源后的热…

2026/8/17 23:22:01