Qwen3.6-35B-A3B 无审查模型本地部署:3 步完成下载、启动与调参 Qwen3.6-35B-A3B 无审查模型本地部署3 步完成下载、启动与调参【免费下载链接】Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive项目地址: https://ai.gitcode.com/hf_mirrors/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-AggressiveQwen3.6-35B-A3B-Uncensored 是 HauhauCS 对 Qwen3.6 35B 参数 MoE 模型做的无审查变体仓库提供 11 种 GGUF 量化文件和视觉投影文件可直接在 llama.cpp、LM Studio 等客户端里运行。下面按部署步骤和参数推荐两条主线带你从零把模型跑起来。项目速览项目内容参数规模总计 35B单次前向激活约 3BMoE即只激活部分专家网络专家路由256 个专家每个 token 路由 8 个注意力结构线性注意力 全 softmax 注意力按 3:1 混合上下文262K 原生支持模态文本、图像、视频原生多模态文件与许可11 个量化 GGUF 1 个 mmproj 视觉文件Apache-2.0仓库里的权重文件都是 GGUF 格式即 llama.cpp 系列客户端可直接加载的量化模型格式mmproj 文件是配合主模型使用、处理图像输入的视觉投影文件需要视觉能力时别漏下载。 获取与部署第 1 步下载模型文件用 git clone 可以一次性拿到全部量化版本和视觉文件省去逐个挑选git clone https://gitcode.com/hf_mirrors/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive各量化文件从 11GB 到 44GB 不等克隆完成后如果磁盘紧张只保留自己要用的一两个版本即可。第 2 步环境准备准备一个 GGUF 兼容的运行时二选一源码安装 llama.cpp或图形界面客户端 LM Studio。装好后用一条命令确认命令行可用llama-cli --version能正常打印版本号说明运行环境已经就绪。第 3 步首次启动以均衡档 Q4_K_P 为例下面这条命令同时启用了视觉投影和 128K 上下文llama-cli -m Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4_K_P.gguf \ --mmproj mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf \ --jinja -c 131072 -ngl 99其中--jinja让 llama.cpp 按官方规则处理对话模板-c 131072指定上下文长度-ngl 99把尽可能多的层放到 GPU。用 LM Studio 的话直接在界面里选中对应的 .gguf 主文件再附加 mmproj 文件即可。⚙️ 核心配置与调参一张表看懂场景参数推荐以下四组参数来自 Qwen 官方团队的建议可直接照抄到客户端的采样设置里场景参数推荐值说明思考模式·通用temperature / top_p / top_k / min_p / presence_penalty1.0 / 0.95 / 20 / 0 / 1.5默认配置适配多数对话思考模式·编码/精确任务同上0.6 / 0.95 / 20 / 0 / 0低温让输出更收敛稳定非思考模式·通用同上0.7 / 0.8 / 20 / 0 / 1.5跳过推理直接作答响应快非思考模式·复杂推理同上1.0 / 1.0 / 40 / 0 / 2.0top_k 放宽扩大候选范围另外有一条硬性要求上下文至少保留 128K。低于这个值模型会放弃深度推理、直接给结论。性能与质量的权衡取舍的关键是内存余量参考三档追质量选 Q8_K_P44GB接近全精度适合评测和重要任务均衡选 Q4_K_P23GBK_P 是按模型逐项分析、选择性保留关键权重的自定义量化文件只比基础量化大 5%~15%质量却接近高一两档内存紧张退到 Q2_K_P15GB或 IQ2_M11GB速度优先质量有损失但日常可用。 进阶与排错加载时内存不足现象加载模型时进程被系统杀掉或机器卡死。原因量化档位与可用内存不匹配Q4_K_P 除了 23GB 权重还要再留上下文开销。解决换 Q2_K_P 或 IQ2_M 等低量化版本关闭其他占内存的程序并适当调小上下文长度。LM Studio 里量化列显示问号现象K_P 版本在 LM Studio 的量化一栏显示为。原因客户端不认识这种自定义量化标签。解决这只是界面展示问题模型能正常加载和推理不需要任何处理。模型不思考直接回答现象模型跳过推理过程直接输出结论回答深度明显下降。原因上下文设置过短或未加--jinja导致对话模板解析错误。解决用-c 131072把上下文恢复到 128K并确保 llama.cpp 启动时带上--jinja。按上面的流程走下来你已经能在本地跑通这套无审查多模态模型先按内存定量化档位再用参数表按场景调采样。下一步可以尝试用 mmproj 输入图像和视频内容或者把模型接入 API 服务做应用集成记得上下文保持 128K 以上。【免费下载链接】Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive项目地址: https://ai.gitcode.com/hf_mirrors/HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

开源视频剪辑与远程桌面工具实战指南:Shotcut、OpenShot、RustDesk、FreeRDP

开源视频剪辑与远程桌面工具实战指南:Shotcut、OpenShot、RustDesk、FreeRDP

你是不是也遇到过这样的困境:想剪个简单的视频,发现专业软件要么太贵,要么功能臃肿;需要远程控制另一台电脑,却发现系统自带的工具限制多多,第三方软件又得付费订阅。在软件工具上,我们似乎总在…

2026/8/24 6:07:36
数字芯片静态时序分析(STA)核心原理与工程实践指南

数字芯片静态时序分析(STA)核心原理与工程实践指南

1. 项目概述:为什么每个数字芯片工程师都必须懂STA?如果你刚入行数字芯片设计或验证,可能会被各种缩写搞得头晕:RTL、CDC、DFT,还有今天要聊的STA。别被“静态时序分析”这个听起来高大上的名字吓到,它本质…

2026/8/24 6:07:36
LTX2.5整合包:8G显存本地运行AI视频生成,从部署到实战全解析

LTX2.5整合包:8G显存本地运行AI视频生成,从部署到实战全解析

最近在折腾AI视频生成,发现很多朋友都被高显存要求劝退了。MiniMaxH3虽然效果惊艳,但动辄16G、32G的显存需求,让很多只有8G、10G显存显卡的玩家望而却步。好消息是,一个名为LTX2.5的强力新选手出现了,它凭借一个精心优…

2026/8/24 6:07:36
AI与反射机制:打造技术真实的程序员简历

AI与反射机制:打造技术真实的程序员简历

1. 项目概述:当AI学会"自查作业"的简历革命去年帮团队筛选应届生简历时,我发现一个有趣现象:80%的Java应聘者在"项目经验"栏写着"电商系统",但追问Redis缓存设计细节时却支支吾吾。这让我意识到&am…

2026/8/24 6:07:36
Prometheus告警系统深度解析:从规则评估到Alertmanager路由实战

Prometheus告警系统深度解析:从规则评估到Alertmanager路由实战

1. 项目概述:从监控数据到告警通知的完整链路在运维和可观测性领域,监控系统收集海量指标只是第一步,真正让数据产生价值、驱动行动的关键环节是告警。Prometheus 作为云原生时代的监控事实标准,其告警机制的设计哲学深深植根于其…

2026/8/24 6:07:35
2026校招AI岗位需求爆发:大模型与转型指南

2026校招AI岗位需求爆发:大模型与转型指南

1. 2026校招市场现状:AI岗位需求爆发式增长作为一名在互联网行业摸爬滚打多年的技术老兵,我亲眼目睹了2026年校招市场的剧烈变化。今年最显著的特征就是AI类岗位呈现井喷式增长,各大厂都在疯狂抢人。根据我拿到的第一手招聘数据,字…

2026/8/24 6:02:35