Qwen3.5-397B-A17B-MoE-MXFP4:AMD优化的3970亿参数多模态大模型完整指南 Qwen3.5-397B-A17B-MoE-MXFP4AMD优化的3970亿参数多模态大模型完整指南【免费下载链接】Qwen3.5-397B-A17B-MoE-MXFP4项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen3.5-397B-A17B-MoE-MXFP4Qwen3.5-397B-A17B-MoE-MXFP4是一款由AMD优化的3970亿参数多模态大模型基于Qwen/Qwen3.5-397B-A17B-FP8构建专为AMD MI350/MI355硬件微架构设计采用MXFP4量化技术在保持高性能的同时显著提升了推理效率。 模型核心特性 多模态输入支持输入类型文本、图像、视频输出类型文本视觉处理采用27层视觉编码器支持16×16图像 patch 大小和2×2时空合并config.json AMD硬件优化支持显卡AMD MI350 / MI355软件栈要求ROCm 7.2.0PyTorch 2.9.1Transformers 5.3.0操作系统Linux 创新MoE架构专家数量512个专家每token选择专家数10个共享专家优化将共享专家量化为MXFP4并融合到MoE内核FSE技术相比BF16减少内存占用并提升解码吞吐量README.md 量化技术解析 MXFP4量化方案权重量化OCP MXFP4静态量化激活量化OCP MXFP4动态量化量化工具AMD-Quark v0.12量化范围所有MoE专家包括共享专家 量化效果在GSM8K基准测试中与原始FP8模型相比准确率97.27%原始模型97.95%恢复率99.31%性能提升显著降低BF16内存占用提升解码吞吐量README.md 快速开始指南 环境准备确保系统已安装ROCm 7.2.0和PyTorch 2.9.1然后克隆仓库git clone https://gitcode.com/hf_mirrors/amd/Qwen3.5-397B-A17B-MoE-MXFP4 cd Qwen3.5-397B-A17B-MoE-MXFP4 使用SGLang启动服务python3 -m sglang.launch_server \ --model-path . \ --tensor-parallel-size 4 \ --trust-remote-code \ --attention-backend aiter \ --mem-fraction-static 0.8 \ --host 0.0.0.0 --port 30000 生成配置参数默认生成配置generation_config.json采样策略temperature0.6top_k20top_p0.95Token设置bos_token_id248044eos_token_id[248046, 248044]最大上下文支持262144 tokensconfig.json 性能评估 推理性能部署框架SGLang并行策略张量并行推荐4卡配置内存优化mem-fraction-static0.8静态内存分配比例 评估复现使用lm-evaluation-harness进行评估lm_eval --model local-chat-completions --apply_chat_template \ --tasks gsm8k.yaml \ --num_fewshot 5 \ --model_args model.,base_urlhttp://127.0.0.1:30000/v1/chat/completions,num_concurrent64 \ --gen_kwargs max_tokens12288,temperature0,top_p1 许可证信息许可证Apache-2.0修改声明© 2026 Advanced Micro Devices, Inc. 保留所有权利原始模型基于Qwen/Qwen3.5-397B-A17B-FP8构建️ 技术细节 模型架构基础架构Qwen3_5MoeForConditionalGeneration隐藏层大小4096注意力头数32查询头2键值头层数60层交替使用线性注意力和全注意力 文件结构模型权重94个分片model.safetensors-00001-of-00094.safetensors至model.safetensors-00094-of-00094.safetensors配置文件config.json模型架构、generation_config.json生成参数分词器tokenizer.json、vocab.json、merges.txt这款由AMD优化的多模态大模型通过创新的MXFP4量化技术和MoE架构设计为企业级AI应用提供了高性能、高效率的解决方案特别适合在AMD MI350/MI355平台上部署大规模语言模型应用。【免费下载链接】Qwen3.5-397B-A17B-MoE-MXFP4项目地址: https://ai.gitcode.com/hf_mirrors/amd/Qwen3.5-397B-A17B-MoE-MXFP4创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

8款实用AI写作辅助平台横向实测,本硕博避坑选型手册

8款实用AI写作辅助平台横向实测,本硕博避坑选型手册

前言:AI 写论文乱象频发,实测 8 款工具理清适配边界 每到毕业季,本科生、硕博生都会集中寻找 AI 论文辅助工具,市面各类写作软件层出不穷。但普遍存在几类硬伤:虚假参考文献、无法匹配本校格式、不支持公式代码生成、A…

2026/9/3 0:54:39
永磁同步电机全速域无传感器复合控制策略研究:基于高频注入与自适应滑模观测的加权融合方法(Simulink仿真实现)

永磁同步电机全速域无传感器复合控制策略研究:基于高频注入与自适应滑模观测的加权融合方法(Simulink仿真实现)

💥💥💞💞欢迎来到本博客❤️❤️💥💥 🏆博主优势:🌞🌞🌞博客内容尽量做到思维缜密,逻辑清晰,为了方便读者。 &#x1f381…

2026/9/3 0:54:39
基于观测器异构冗余与柔性切换的永磁同步电机宽速域无传感器控制关键技术研究(Simulink仿真实现)

基于观测器异构冗余与柔性切换的永磁同步电机宽速域无传感器控制关键技术研究(Simulink仿真实现)

💥💥💞💞欢迎来到本博客❤️❤️💥💥 🏆博主优势:🌞🌞🌞博客内容尽量做到思维缜密,逻辑清晰,为了方便读者。 &#x1f381…

2026/9/3 0:54:39
答辩前我试了十多款AI做PPT,最后留下这几款:2026开题/答辩工具选型指南

答辩前我试了十多款AI做PPT,最后留下这几款:2026开题/答辩工具选型指南

毕业季最让人崩溃的,往往不是写论文,而是: 三万字论文,怎么压缩成15分钟答辩PPT?开题报告明明写好了,PPT却不知道该放什么;AI生成的PPT看着挺好看,内容却和原文对不上;答…

2026/9/3 0:54:39
国产长芯微LPA603完全P2P替代AD603,是一款低噪声、轨到轨输出的压控放大器

国产长芯微LPA603完全P2P替代AD603,是一款低噪声、轨到轨输出的压控放大器

产品描述 LPA603是一款低噪声、轨到轨输出的压控放大器,适用于射频和中频自动增益控制(AGC)系统。它提供精确的、引脚可选增益范围,从1dB至28dB,带宽为75MHz,或从21dB至48dB,带宽为12MHz。通过…

2026/9/3 0:49:38
软件测试面试通关指南:从测试用例设计到AI测试实战

软件测试面试通关指南:从测试用例设计到AI测试实战

今天上午面了 4 个软件测试岗候选人,结束之后我最大的感受是:多数人的问题不是“技术深度不够”,而是基础不牢、表达混乱、项目经不起追问。有人能背出一整段八股文,但让他现场给一个登录功能设计测试用例,他只能说出“…

2026/9/3 0:49:38