英伟达开源离散扩散语言模型,吞吐量提升 2.42 倍破解大模型生成慢难题 【导语英伟达日前开源了 Nemotron-Labs-TwoTower 离散扩散语言模型该模型基于现有骨干网络改造降低了开发成本。其独特的双塔架构大幅提升了推理吞吐量兼顾速度与输出效果开发者可自由下载测试和商用部署。】开源模型降低成本破解生成速度难题英伟达开源的 Nemotron-Labs-TwoTower 离散扩散语言模型旨在解决大模型逐一生成 Token 速度慢的痛点。此模型基于现有 Nemotron 骨干网络改造复用预训练权重无需从零完整训练这一举措大幅降低了开发成本。双塔架构并行生成拉高推理吞吐量该模型总参数量 60B拆分为两座 30B 独立神经网络协同工作每塔激活 3B 参数搭载 128 个可路由专家模块。上下文塔固定冻结负责留存全文语义信息去噪塔专门训练依靠扩散机制并行生成文本两塔通过交叉注意力互通数据。与传统模型逐 Token 串行输出不同双塔架构可并行写入文本大幅拉高了推理吞吐量。性能测试速度与质量实现平衡多类基准测试数据显示模型综合能力保留原版 98.7% 水准文本生成吞吐速度直接提升 2.42 倍仅代码、数学类任务小幅下滑。测试覆盖常识、数学、代码、阅读理解等多项任务多数指标与原版基本持平平衡了生成速度与内容质量。开源协议与运行要求推动模型落地应用该模型采用英伟达专属开源协议开放权重开发者可自由下载测试、商用部署。运行需搭配双张 H100 或 A100 80GB 显卡单卡仅支持纯自回归模式双塔完整推理需双卡协同。编辑观点英伟达开源的离散扩散语言模型在降低开发成本的同时显著提升了生成速度且保证了内容质量有望在自然语言处理领域得到广泛应用推动行业发展。

相关新闻

最新新闻

LLM Agent隐私风险:从静态存储到动态通道的安全范式转变

LLM Agent隐私风险:从静态存储到动态通道的安全范式转变

1. 从“存储”到“通道”:重新审视LLM Agent的隐私风险边界最近在跟进几个大型语言模型(LLM)智能体(Agent)的落地项目时,我和团队遇到了一个很有意思的挑战。我们按照常规的安全审计流程,把所有…

2026/8/22 0:43:48
NPM强制2FA令牌安全策略:如何更新访问令牌保障CI/CD发布流程

NPM强制2FA令牌安全策略:如何更新访问令牌保障CI/CD发布流程

这次我们来看一个对 Node.js 开发者至关重要的安全更新:NPM 官方宣布,绕过双因素认证(2FA)的访问令牌(tokens)将无法再管理账户或发布包。这不是一个新功能,而是一项强制性的安全策略收紧&#…

2026/8/22 0:43:48
从零到跑通第一个机器人模型:Robotics Toolbox for Python 完整安装指南

从零到跑通第一个机器人模型:Robotics Toolbox for Python 完整安装指南

从零到跑通第一个机器人模型:Robotics Toolbox for Python 完整安装指南 【免费下载链接】robotics-toolbox-python Robotics Toolbox for Python 项目地址: https://gitcode.com/gh_mirrors/ro/robotics-toolbox-python Robotics Toolbox for Python 把运动…

2026/8/22 0:43:48
大厂AI算力竞赛:阿里变现领先,中国互联网轻资产时代落幕

大厂AI算力竞赛:阿里变现领先,中国互联网轻资产时代落幕

大厂AI算力竞赛拉开帷幕 8月20日晚,阿里巴巴发布2027财年一季度财报,新分部“AI云与算力服务”单季收入484亿元,同比增长45%,大厂AI生意大到单独做损益表。而在腾讯,8月12日电话会上,总裁刘炽平提出“保底方…

2026/8/22 0:43:48
【算子开发】CUDA执行模型与占用率

【算子开发】CUDA执行模型与占用率

常量内存特性与广播机制 在 CUDA 的内存层级中,常量内存(Constant Memory)是一块常被忽视却极具特色的存储空间。它的容量只有 64KB,相较于全局内存动辄数 GB 的规模显得微不足道,但正是这个"小而精"的设计&…

2026/8/22 0:43:48
计数型控制图c图/u图:缺陷率监控正确姿势

计数型控制图c图/u图:缺陷率监控正确姿势

一、痛点背景:从一次真实的生产事故说起计数型控制图c图/u图:缺陷率监控正确姿势这个问题,在FAB里不是一天两天了。我见过太多工程师踩坑:要么是方法用错导致数据误判,要么是工具选型失误导致项目延期,要么…

2026/8/22 0:38:47