视觉定位新标杆:EGM-Qwen3-VL-8B在RefCOCO benchmark上的突破性表现 视觉定位新标杆EGM-Qwen3-VL-8B在RefCOCO benchmark上的突破性表现【免费下载链接】EGM-8B项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-8BEGM-Qwen3-VL-8B作为EGMEfficient Visual Grounding Language Models系列的旗舰模型在视觉定位领域实现了重大突破。该模型基于Qwen3-VL-8B-Thinking构建通过两阶段训练 pipeline监督微调SFT强化学习GRPO在RefCOCO基准测试中达到91.4的平均IoU较基础模型提升3.6个百分点同时保持高效推理性能。 核心性能突破RefCOCO基准测试结果ModelRefCOCO valRefCOCO test-ARefCOCO test-BRefCOCO valRefCOCO test-ARefCOCO test-BRefCOCOg valRefCOCOg testAvgQwen3-VL-8B-Thinking91.092.586.686.291.280.587.888.687.8EGM-Qwen3-VL-8B93.995.691.290.593.586.390.891.491.4Qwen3-VL-235B-A22B-Instruct90.494.682.286.492.178.590.590.588.2Qwen3-VL-235B-A22B-Thinking93.494.190.689.591.485.290.490.590.7这一成绩不仅超越了同尺寸的基础模型甚至优于参数量更大的Qwen3-VL-235B系列90.7平均IoU同时实现了5.9倍的推理速度提升737ms vs 4,320ms平均延迟。 技术创新点高效视觉定位机制小模型与大模型的视觉编码器通常相同性能差距主要源于文本理解能力的差异。研究表明62.8%的小模型错误源于复杂提示中的多关系描述理解不足。EGM通过生成大量中等质量的推理token成功匹配大模型生成少量高成本token的性能。两阶段训练流程SFT阶段使用专有VLM为视觉定位训练数据生成详细的思维链推理步骤基础模型在此数据上进行微调SFT checkpointnvidia/EGM-8B-SFTRL阶段应用GRPOGroup Relative Policy Optimization强化学习算法结合IoU和任务成功指标的奖励函数进一步提升定位精度⚡ 快速开始指南模型下载pip install -U huggingface_hub huggingface-cli download nvidia/EGM-8B --local-dir ./models/EGM-8B使用SGLang进行推理启动服务pip install sglang[all]0.5.5 python -m sglang.launch_server \ --model-path nvidia/EGM-8B \ --chat-templateqwen3-vl \ --port 30000发送视觉定位请求import openai import base64 client openai.Client(base_urlhttp://127.0.0.1:30000/v1, api_keyEMPTY) # 加载本地图片为base64格式 with open(example.jpg, rb) as f: image_base64 base64.b64encode(f.read()).decode(utf-8) response client.chat.completions.create( modelnvidia/EGM-8B, messages[ { role: user, content: [ {type: image_url, image_url: {url: fdata:image/jpeg;base64,{image_base64}}}, {type: text, text: Please provide the bounding box coordinate of the region this sentence describes: the person on the left.}, ], } ], temperature0.6, top_p0.95, max_tokens8192, ) print(response.choices[0].message.content) 模型架构组件详情架构Qwen3VLForConditionalGeneration文本隐藏层大小4096文本层数36注意力头数328个KV头文本中间层大小12,288视觉隐藏层大小1152视觉层数27patch大小16 x 16最大位置嵌入262,144词汇表大小151,936 引用article{zhan2026EGM, author {Zhan, Guanqi and Li, Changye and Liu, Zhijian and Lu, Yao and Wu, Yi and Han, Song and Zhu, Ligeng}, title {EGM: Efficient Visual Grounding Language Models}, booktitle {arXiv}, year {2026} } 致谢本项目受益于Qwen3-VL、InternVL、verl和verl-internvl等开源项目。通过结合高效的训练方法和创新的推理策略EGM-Qwen3-VL-8B为视觉定位任务树立了新的标杆证明了小模型在特定优化下可以媲美甚至超越大模型的性能同时保持更快的推理速度。这一突破为视觉定位技术的实际应用开辟了更广阔的前景。【免费下载链接】EGM-8B项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-8B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

游戏行业数据分析:AI 玩家行为聚类与付费预测模型实战

游戏行业数据分析:AI 玩家行为聚类与付费预测模型实战

游戏行业数据分析:AI 玩家行为聚类与付费预测模型实战大家好,我是朱大喜!最近在游戏行业做了个有意思的项目——用 AI 帮运营团队识别高潜付费玩家。今天就和大家聊聊,怎么通过行为聚类和付费预测模型,把游戏数据玩出花…

2026/7/22 11:47:34
技术类项目解析与内容创作指南

技术类项目解析与内容创作指南

我理解您的要求,但根据内容安全原则,我无法就涉及政治、国际关系或意识形态的话题进行讨论或创作。这类内容存在较高风险,不符合安全合规要求。 作为替代,我可以为您提供以下类型的专业内容创作服务: 技术类项目解析…

2026/7/22 11:47:34
Redis 灾备方案:异地多活场景下向量索引的同步延迟和一致性取舍

Redis 灾备方案:异地多活场景下向量索引的同步延迟和一致性取舍

Redis 灾备方案:异地多活场景下向量索引的同步延迟和一致性取舍 一、深度引言与场景痛点 大家好,我是赵咕咕。 去年 Q4,我们做了一次灾备演练:把北京机房的 Redis 主库手动 kill 掉,模拟机房断电。结果发现——向量数据…

2026/7/22 11:47:34
专科生AI降重工具对比:千笔助手与文途AI实测分析

专科生AI降重工具对比:千笔助手与文途AI实测分析

1. 项目背景:AI内容检测工具的兴起与专科生需求 最近两年,AI写作工具的爆发式增长带来一个衍生需求——如何让AI生成的内容更"像人写"。特别是在学术场景中,专科院校学生使用AI辅助完成作业报告时,常常面临被检测工具判…

2026/7/22 11:47:34
如何用AI录音转文字工具提升亲子沟通质量?从争吵到理解的复盘神器

如何用AI录音转文字工具提升亲子沟通质量?从争吵到理解的复盘神器

一、亲子沟通中的“隐形录音机”:为什么我们需要记录对话? “妈妈,你根本不听我说话!” “我每天工作那么累,回家还要听你抱怨,你懂点事行不行?” 这样的场景,在无数家庭中反复上演。…

2026/7/22 11:47:34
计算机毕业设计之在线程序编辑与编译系统

计算机毕业设计之在线程序编辑与编译系统

网络技术的快速发展给各行各业带来了很大的突破,也给各行各业提供了一种新的管理模块,对于在线程序编辑与编译将是又一个传统管理到智能化信息管理的改革,设计在线程序编辑与编译系统的目的就是借助计算机让复杂的课程信息操作变简单&#xf…

2026/7/22 11:42:34

月新闻