0.6B 硬刚 8B/20B!Xiaothink-T17-RWKV5-MLA-Instruct-Pro 六领域盲测实录:指令遵循 90.7 全场第一 一、0.6B 凭什么和 8B、20B 同台“参数量差两个数量级直接不用比了”——这是很多人的第一反应。但小思框架Xiaothink最新发布的Xiaothink-T17-RWKV5-MLA-Instruct-Pro≈0.6B却在一次 6 领域盲测中和 8B 的 llama、20B 的 gpt-oss 甚至云端旗舰同台竞技还在指令遵循这个硬指标上拿了全场第一。这篇文章把盲测实录完整摆出来用数据说话。模型在线Demo体验首次进入若跳转到主页请重进链接二、盲测是怎么做的裁判DeepSeek-V4-Flash开启深度思考负责对照评分评测领域6 个 1B 定制中文领域——古诗生成、古诗赏析、前端页面生成、通用知识、指令遵循、长文本处理题目数量每个领域 3 题共 18 题评分维度准确性 30% 关联性 30% 创造性 40%页面生成任务改用“样式艺术感 40% 内容与功能丰富度 40%”评分方式把本模型与所有静态模型对同一问题的回答匿名编号一次性交给裁判对照打分降低偏见本模型采样温度梯度 [0.68, 0.92] 共 2 个梯度点 × 3 次重复 每题 6 次对照评分取最高分静态模型取平均分对照模型Qwen3-0.6B、llama-3-8B-instruct、gpt-oss-20B、DeepSeek-V4-Flash三、分领域成绩单领域T17-Instruct-Pro0.6BQwen3-0.6Bllama-3-8Bgpt-oss-20BDeepSeek-V4-Flash古诗生成74.036.457.443.492.4古诗赏析67.072.671.671.891.7前端页面生成25.034.950.167.693.7通用知识85.069.583.690.687.7指令遵循90.778.289.780.677.5长文本处理50.085.076.593.089.6总体平均65.362.871.574.588.8四、亮点逐条看1. 指令遵循 90.7全场第一。这个领域考的是“会不会听指令”说输出一句话就一句话、说 30 字内就 30 字内。本模型 90.7 分超过了 llama-3-8B89.7、gpt-oss-20B80.6、Qwen3-0.6B78.2甚至超过云端 DeepSeek-V4-Flash77.5。指令微调带来的格式服从能力在 0.6B 上体现得相当扎实。2. 通用知识 85.0越过 8B。本模型 85.0比 llama-3-8B 的 83.6 还高逼近 20B 的 gpt-oss-20B90.6而 Qwen3-0.6B 只有 69.5。3. 古诗生成 74.00.6B 级断档领先。Qwen3-0.6B 只有 36.4差距明显本模型甚至超过 llama-3-8B57.4和 gpt-oss-20B43.4仅次于 DeepSeek92.4。中文韵律和意象的建模能力是它的强项。4. 总体 65.3反超同尺寸 Qwen3-0.6B62.8。在同参数量级内做到了更好的中文综合表现。五、也得实事求是一下前端页面生成 25.0 是全部模型里最低的——原因很明确这个模型是在 t17_rwkv5_mla_instruct_frontend 基础上继续微调的微调重心放在了中文自然语言上代价就是前端WF生成能力相比 frontend 版明显下降。需要前端页面生成请选用t17_rwkv5_mla_frontend需要自然语言对话、创作、指令任务本模型是更合适的选择。这也是一次清晰的“能力再分配”实验。六、总结T17-RWKV5-MLA-Instruct-Pro0.6B在 6 领域盲测中总体 65.3超过同尺寸 Qwen3-0.6B指令遵循 90.7 全场第一、通用知识 85.0 越过 8B、古诗生成 74.0 断档领先同尺寸前端生成 25.0 是微调取舍的代价选型时按任务场景二选一。数据来自真实的 DeepSeek-V4-Flash 对照盲测。欢迎交流讨论模型下载ModelScopeXiaothink-T17-RWKV5-MLA-0.6B-Instruct-Pro

相关新闻

最新新闻

REFramework 怪物猎人荒野 稳定使用指南

REFramework 怪物猎人荒野 稳定使用指南

REFramework 怪物猎人荒野 稳定使用指南 【免费下载链接】REFramework Mod loader, scripting platform, and VR support for all RE Engine games 项目地址: https://gitcode.com/GitHub_Trending/re/REFramework REFramework 是 RE Engine 游戏上最常用的 MOD 框架。这…

2026/8/24 15:13:08
从环境配置到代码审查:构建稳定高效的AI编程工作流四步法

从环境配置到代码审查:构建稳定高效的AI编程工作流四步法

你有没有过这样的经历:想用AI辅助编程,结果折腾了半天,不是环境装不上,就是提示词不灵,好不容易跑通了,一到代码审查环节又被打回原形,感觉AI编程工具就是个“玩具”,离真正的生产力…

2026/8/24 15:13:08
通义千问本地部署只需4步:用 FlashAI 免费离线跑通大模型

通义千问本地部署只需4步:用 FlashAI 免费离线跑通大模型

通义千问本地部署只需4步:用 FlashAI 免费离线跑通大模型 【免费下载链接】通义千问 FlashAI一键本地部署通义千问大模型整合包 项目地址: https://ai.gitcode.com/FlashAI/qwen 想在本地电脑上跑起通义千问,又怕折腾环境、担心数据外传&#xff…

2026/8/24 15:13:08
HandheldCompanion 完整上手指南:给 Windows 掌机加上体感控制与性能快调

HandheldCompanion 完整上手指南:给 Windows 掌机加上体感控制与性能快调

HandheldCompanion 完整上手指南:给 Windows 掌机加上体感控制与性能快调 【免费下载链接】HandheldCompanion A touch optimized GUI to increase your handheld gaming computer experience. 项目地址: https://gitcode.com/gh_mirrors/ha/HandheldCompanion …

2026/8/24 15:13:08
Stretchly 自定义休息界面:3 个 HTML 文件、4 个 CSS 文件改出你的提示屏

Stretchly 自定义休息界面:3 个 HTML 文件、4 个 CSS 文件改出你的提示屏

Stretchly 自定义休息界面:3 个 HTML 文件、4 个 CSS 文件改出你的提示屏 【免费下载链接】stretchly The break time reminder app 项目地址: https://gitcode.com/gh_mirrors/st/stretchly Stretchly 是一个开源的休息提醒应用,它把迷你休息和长…

2026/8/24 15:13:08
自己动手写Agent Harness【cmd-builtin】:实现cmd 与内置命令

自己动手写Agent Harness【cmd-builtin】:实现cmd 与内置命令

写在前面:系列是为了帮助大家更好的去理解Agent Harness基础设施,并不是想重复造轮子,真实开发建议选择一个成熟的SDK或Harness框架,才是最合适的选择~ 1. loop 里缺一个方向盘 之前写的《自己动手实现一个 agent:生命…

2026/8/24 15:08:07