256个专家只激活3B参数:Ornith-1.5-35B-A3B MoE架构为什么能赢过稠密大模型 256个专家只激活3B参数Ornith-1.5-35B-A3B MoE架构为什么能赢过稠密大模型【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3BOrnith-1.5-35B-A3B 是 Ornith-1.5 家族中基于 MoEMixture of Experts混合专家架构的多模态推理模型总参数约 35B但每个 token 只激活约 3B 参数推理成本接近小模型却在 SWE-bench Verified、Terminal-Bench 等编码与 Agent 基准上全面超过 Gemma-4-31B 等稠密模型。一、什么是 MoE把全员加班改成按需点将传统稠密模型处理每个 token 时所有参数都要参与计算模型越大、每次推理越贵。MoE 的思路是把每一层里最重的专家网络FFN 模块拆成很多个小组再配一个路由器Router每个 token 只选少数几个专家来处理。这样总参数大→ 知识容量大能记住更多模式激活参数小→ 单次推理计算量小、速度快Ornith-1.5-35B-A3B 的名字就概括了它的身份35B是总参数A3BActivated 3B是每 token 实际激活的参数。二、256个专家、每层选8个它是怎么分配的打开 config.json能看到核心 MoE 参数关键配置数值含义num_experts256每层配备 256 个专家 FFNnum_experts_per_tok8每个 token 只激活 8 个专家num_hidden_layers40语言主干共 40 层hidden_size2048隐藏层维度moe_intermediate_size512单个专家内部宽度vocab_size248320词表规模也就是说每层有 256 个专家路由器为每个 token 挑选 8 个约 3%。256 个专家 × 40 层就是它 35B 总参数的大头所在而每次前向传播真正干活的只有 3B 左右这就是 A3B 的由来。从权重清单 model.safetensors.index.json 还能看到一个重要细节每层除了 256 个可选专家外还额外配了 1 个shared_expert共享专家。 为什么需要共享专家被选中的 8 个专家只负责个性化能力而所有 token 都会经过的共享专家则承载通用语言能力两者相加保证任何 token 都有稳定的基础能力托底。这是当前 MoE 模型的常见稳健设计。三、不只是 MoE线性注意力让长上下文更便宜config.json里的layer_types字段揭示了另一个隐藏亮点——注意力混合结构每 4 层中有3 层是linear_attention线性注意力只有第 4 层是full_attention完整注意力层还采用 GQAnum_key_value_heads2仅 2 个 KV 头这意味着 262,144256Ktoken 的上下文窗口下历史信息的记忆与计算开销大幅降低长文档、大代码库场景不再被 KV Cache 拖垮。这也是为什么官方推荐在 2×80GB GPU 上以 256K 上下文部署并用--enable-prefix-caching复用前缀。四、3B激活参数凭什么碾压稠密巨兽MoE 的优势不是玄学而是三个因素的叠加容量与成本的解耦稠密模型想要更强能力只能把每个 token 的计算量一起做大Ornith-1.5-35B-A3B 用 256 个专家堆出 35B 容量推理却只花 3B 的算力——装得下大知识跑得快。稀疏激活 专家分工路由器让不同专家逐渐擅长不同类型的任务语法、数学、代码、工具调用……token 按需点将。对比同规模的 Qwen3.6-35B-A3B 和稠密的 Gemma-4-31BOrnith-1.5-35B-A3B 在 Agent 编码类基准上领先幅度最大正说明这种分工在多步骤工具使用上收益最高。自改进训练放大了架构红利根据 READMEOrnith-1.5 的突破在于端到端自改进循环模型持续自己生成训练任务、构造求解脚手架、用强化学习打磨策略。好的架构MoE 线性注意力提供了能力上限自改进训练把上限兑现了出来。五、官方基准成绩一览以下为 README 公布的五次独立运行均值节选基准Ornith-1.5-35B-A3BQwen3.6-35B-A3BGemma-4-31B稠密Qwen3.5-397BSWE-bench Verified79.073.452.076.4SWE-bench Pro59.649.535.751.6Terminal-Bench 2.1 (Terminus-2)67.852.542.153.5NL2Repo46.229.415.536.8GPQA Diamond89.286.084.388.4可以看到一个只跑 3B 参数的 MoE 模型在多数编码/Agent 项上追平甚至超过了 397B 的 Qwen3.5——这就是稀疏激活对稠密大模型的降维打击。六、新手部署速查2×80GB 显卡跑满 256K 上下文完整参数bf16约70GB官方推荐 2×80GB GPU 部署并保留 256K 上下文的显存余量运行时要求Transformers ≥ 5.8.1、vLLM ≥ 0.19.1 或 SGLang ≥ 0.5.9关键启动参数--tensor-parallel-size 2、--max-model-len 262144、开启前缀缓存并启用推理解析器--reasoning-parser qwen3与工具调用解析器建议采样参数通用任务temperature0.6, top_p0.95, top_k20与 generation_config.json 一致上下文不够用时官方验证过 YaRN 缩放factor4.0 可扩到约 1M token⚠️ 注意Ornith-1.5-35B-A3B 是推理模型助手回复会先输出think…/think思考块再给答案服务端需开启 reasoning parser否则思维链会混进正文。七、写在最后为什么值得你关注这个模型对新手而言Ornith-1.5-35B-A3B 的价值可以浓缩成三句话MoE 让大模型变得可部署——35B 容量 3B 激活成本双 80G 卡即可本地跑 Agent 编码256 专家 1 共享专家的组合兼顾了专业分工与基础稳定线性注意力 256K 上下文让它能吞下整个代码库成为真正可用的终端编码 Agent。想深入了解架构与自改进训练细节可直接阅读仓库内的 README.md含全部评测口径说明与 config.json全部结构参数。【免费下载链接】Ornith-1.5-35B-A3B项目地址: https://ai.gitcode.com/hf_mirrors/ornith-ai/Ornith-1.5-35B-A3B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

本地AI模型部署实战:从环境搭建到批量任务自动化

本地AI模型部署实战:从环境搭建到批量任务自动化

这次我们来看一个关于本地模型部署与应用的实战话题。当“免费”和“本地”这两个词组合在一起,意味着我们有机会在个人电脑上,不依赖云端服务,直接运行各类AI模型。这不仅仅是技术探索,更是对硬件资源利用、数据隐私保护和个性化…

2026/8/25 12:19:37
【信息科学与工程学】信息科学领域——第一百三十三篇 半导体器件物理与电子封装21

【信息科学与工程学】信息科学领域——第一百三十三篇 半导体器件物理与电子封装21

编号3599:压电能量收集器机电耦合模型(模型)—— 能源 编号 类型 领域 问题 数学分析及数学物理分析及数学化学分析(含多数学工具推理) 定律/理论逐步推理的数学表达式及参数设计 关联知识 3599 模型 能源 建立悬臂梁式压电能量收集器模型,PZT-5H,谐振频率100…

2026/8/25 12:19:37
AI图表自动化:从文本描述到专业架构图的技术实践

AI图表自动化:从文本描述到专业架构图的技术实践

1. 先搞清楚“diagram-design”到底要解决什么问题看到“diagram-design:别再凑合给 AI 配圆角方块图”这个标题,很多人的第一反应可能是:这不就是个画图工具吗?或者,是不是又一个AI画图的应用?如果你这么想…

2026/8/25 12:19:37
【信息科学与工程学】信息科学领域——第一百三十三篇 半导体器件物理与电子封装22

【信息科学与工程学】信息科学领域——第一百三十三篇 半导体器件物理与电子封装22

: Rapidus 2HP:逻辑密度237.31 MTr/mm,与台积电N2的236.17 MTr/mm相当;2027财年下半年量产,初期6000片/月,一年内提升至2.5万片/月 High-NA EUV:NA从0.33→0.55,可分辨8nm特征,量产窗口2027-2028年,Intel 14A为首个插入点;金属氧化物光刻胶的LER与缺陷率是经济性闸…

2026/8/25 12:19:37
游戏开发核心:一维与二维数组在矩阵类问题中的高效应用

游戏开发核心:一维与二维数组在矩阵类问题中的高效应用

最近在开发一个简单的扫雷游戏时,我遇到了一个核心问题:如何高效地表示和操作棋盘上的格子状态?是使用一维数组,还是二维数组?这个问题看似基础,却直接关系到后续游戏逻辑的清晰度和代码的可维护性。相信很…

2026/8/25 12:19:37
【信息科学与工程学】【数据中心】第三十五篇 云计算数据中心的学科知识08

【信息科学与工程学】【数据中心】第三十五篇 云计算数据中心的学科知识08

云计算系统集成型解决方案 学科知识续表(D3985~D4044,新增60个编号) 编号 学科(课程) 核心知识点 在云计算/云存储/云网络/云安全/云MaaS中的作用 代表教材/资料/论文 + 数学方程式列表 工业界应用 D3985​ 云安全:IAM(身份与访问管理深度)​ IAM(用户/角色/…

2026/8/25 12:14:36