视觉定位新标杆:EGM-Qwen3-VL-8B在RefCOCO benchmark上的突破性表现
视觉定位新标杆EGM-Qwen3-VL-8B在RefCOCO benchmark上的突破性表现【免费下载链接】EGM-8B项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-8BEGM-Qwen3-VL-8B作为EGMEfficient Visual Grounding Language Models系列的旗舰模型在视觉定位领域实现了重大突破。该模型基于Qwen3-VL-8B-Thinking构建通过两阶段训练 pipeline监督微调SFT强化学习GRPO在RefCOCO基准测试中达到91.4的平均IoU较基础模型提升3.6个百分点同时保持高效推理性能。 核心性能突破RefCOCO基准测试结果ModelRefCOCO valRefCOCO test-ARefCOCO test-BRefCOCO valRefCOCO test-ARefCOCO test-BRefCOCOg valRefCOCOg testAvgQwen3-VL-8B-Thinking91.092.586.686.291.280.587.888.687.8EGM-Qwen3-VL-8B93.995.691.290.593.586.390.891.491.4Qwen3-VL-235B-A22B-Instruct90.494.682.286.492.178.590.590.588.2Qwen3-VL-235B-A22B-Thinking93.494.190.689.591.485.290.490.590.7这一成绩不仅超越了同尺寸的基础模型甚至优于参数量更大的Qwen3-VL-235B系列90.7平均IoU同时实现了5.9倍的推理速度提升737ms vs 4,320ms平均延迟。 技术创新点高效视觉定位机制小模型与大模型的视觉编码器通常相同性能差距主要源于文本理解能力的差异。研究表明62.8%的小模型错误源于复杂提示中的多关系描述理解不足。EGM通过生成大量中等质量的推理token成功匹配大模型生成少量高成本token的性能。两阶段训练流程SFT阶段使用专有VLM为视觉定位训练数据生成详细的思维链推理步骤基础模型在此数据上进行微调SFT checkpointnvidia/EGM-8B-SFTRL阶段应用GRPOGroup Relative Policy Optimization强化学习算法结合IoU和任务成功指标的奖励函数进一步提升定位精度⚡ 快速开始指南模型下载pip install -U huggingface_hub huggingface-cli download nvidia/EGM-8B --local-dir ./models/EGM-8B使用SGLang进行推理启动服务pip install sglang[all]0.5.5 python -m sglang.launch_server \ --model-path nvidia/EGM-8B \ --chat-templateqwen3-vl \ --port 30000发送视觉定位请求import openai import base64 client openai.Client(base_urlhttp://127.0.0.1:30000/v1, api_keyEMPTY) # 加载本地图片为base64格式 with open(example.jpg, rb) as f: image_base64 base64.b64encode(f.read()).decode(utf-8) response client.chat.completions.create( modelnvidia/EGM-8B, messages[ { role: user, content: [ {type: image_url, image_url: {url: fdata:image/jpeg;base64,{image_base64}}}, {type: text, text: Please provide the bounding box coordinate of the region this sentence describes: the person on the left.}, ], } ], temperature0.6, top_p0.95, max_tokens8192, ) print(response.choices[0].message.content) 模型架构组件详情架构Qwen3VLForConditionalGeneration文本隐藏层大小4096文本层数36注意力头数328个KV头文本中间层大小12,288视觉隐藏层大小1152视觉层数27patch大小16 x 16最大位置嵌入262,144词汇表大小151,936 引用article{zhan2026EGM, author {Zhan, Guanqi and Li, Changye and Liu, Zhijian and Lu, Yao and Wu, Yi and Han, Song and Zhu, Ligeng}, title {EGM: Efficient Visual Grounding Language Models}, booktitle {arXiv}, year {2026} } 致谢本项目受益于Qwen3-VL、InternVL、verl和verl-internvl等开源项目。通过结合高效的训练方法和创新的推理策略EGM-Qwen3-VL-8B为视觉定位任务树立了新的标杆证明了小模型在特定优化下可以媲美甚至超越大模型的性能同时保持更快的推理速度。这一突破为视觉定位技术的实际应用开辟了更广阔的前景。【免费下载链接】EGM-8B项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-8B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

LangChain 学习笔记:核心整理(黑马课程版 vs 新版生产写法)

LangChain 学习笔记:核心整理(黑马课程版 vs 新版生产写法)

一、模型初始化(2‑2 models.ipynb)1、两种初始化模型方式底层模型:ChatOpenAI,兼容 DeepSeek‑Chat、GPT‑4o 等遵循 OpenAI 协议的模型;配置文件统一放在 .env。# .env文件 OPENAI_API_KEYsk‑xxx OPENAI_BASE_URLht…

2026/7/21 20:54:23 阅读更多 →
小程序计算机毕设之基于 SpringBoot + 微信小程序的成都美食分享可视化系统的设计与实现(完整前后端代码+说明文档+LW,调试定制等)

小程序计算机毕设之基于 SpringBoot + 微信小程序的成都美食分享可视化系统的设计与实现(完整前后端代码+说明文档+LW,调试定制等)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/22 0:15:07 阅读更多 →
小程序计算机毕设之基于小程序的川渝短途旅游自助服务平台 川味文化旅游推荐与路线规划小程序 本土化特色文旅推广服务小程序(完整前后端代码+说明文档+LW,调试定制等)

小程序计算机毕设之基于小程序的川渝短途旅游自助服务平台 川味文化旅游推荐与路线规划小程序 本土化特色文旅推广服务小程序(完整前后端代码+说明文档+LW,调试定制等)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/7/22 0:15:55 阅读更多 →

最新新闻

TPS65810/11 I2C通信与寄存器配置实战指南

TPS65810/11 I2C通信与寄存器配置实战指南

1. 项目概述与I2C协议基础在嵌入式硬件开发,尤其是涉及复杂电源管理的系统中,与电源管理芯片(PMIC)的可靠通信是项目成败的关键一环。TPS65810和TPS65811是德州仪器(TI)推出的两款高度集成的电源管理单元&a…

2026/7/24 7:23:26 阅读更多 →
AI技术提升专著写作效率的三大核心方法

AI技术提升专著写作效率的三大核心方法

1. 专著写作的痛点与AI解决方案 去年我接手了一本行业技术专著的编写任务,原计划用半年时间完成,结果光是文献梳理和初稿撰写就耗费了四个多月。直到偶然发现AI工具的组合用法,才将后期效率提升了300%。现在我把这套经过实战验证的方法拆解为…

2026/7/24 7:23:26 阅读更多 →
MOE混合专家模型:原理、优势与应用实践

MOE混合专家模型:原理、优势与应用实践

1. MOE混合专家模型的核心概念MOE(Mixture of Experts)混合专家模型是一种特殊的神经网络架构,它的核心思想是将复杂任务分解为多个子任务,由不同的"专家"网络分别处理,再通过门控机制(Gating Ne…

2026/7/24 7:23:26 阅读更多 →
LLM Agent构建指南:从核心原理到金融实战

LLM Agent构建指南:从核心原理到金融实战

1. 理解LLM Agent的核心价值LLM Agent(大型语言模型智能体)正在彻底改变我们与AI系统的交互方式。不同于传统单一功能的AI模型,一个设计良好的LLM Agent更像是一个数字世界的全能助手,能够理解复杂指令、规划任务流程、调用各种工…

2026/7/24 7:23:26 阅读更多 →
SAR ADC评估套件实战:从硬件配置到性能分析的完整指南

SAR ADC评估套件实战:从硬件配置到性能分析的完整指南

1. 项目概述:深入解析SAR ADC评估套件的核心价值在信号链设计的核心地带,模数转换器(ADC)扮演着将现实世界连续变化的模拟信号,精准转换为数字系统可处理的离散代码的关键角色。对于追求高精度、中等速度与低功耗平衡的…

2026/7/24 7:23:26 阅读更多 →
军储空间神经系统:三维实时监控与爆炸风险预测技术

军储空间神经系统:三维实时监控与爆炸风险预测技术

1. 项目概述:军储空间神经系统的技术革命在军事仓储安全管理领域,传统二维监控系统正面临根本性挑战。当价值连城的战略物资与高危爆炸物共处同一空间时,仅知道"画面中有人"远远不够,关键是要精确掌握每个目标的实时三维…

2026/7/24 7:22:26 阅读更多 →

日新闻

用Highcharts 创建可拖拽三维散点立方体3D图表

用Highcharts 创建可拖拽三维散点立方体3D图表

该案例基于Highcharts scatter3d 三维散点图实现空间立方体散点可视化,核心特色:三维 X/Y/Z 三轴空间,所有散点分布在 0~10 立方体空间内;散点使用径向渐变实现立体 3D 圆球质感;支持鼠标 / 触屏拖拽画布,…

2026/7/24 0:00:29 阅读更多 →
AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口

AppCertDlls:进程创建路径上的 DLL 入口 AppCertDlls 位于 HKLM\System\CurrentControlSet\Control\Session Manager\AppCertDlls。本文的程序功能是只读列出这个键在 64 位和 32 位注册表视图中的全部值,并显示每条值的来源、名称、类型和可安全显示的数…

2026/7/24 0:00:29 阅读更多 →
我的编程之路:第一篇博客

我的编程之路:第一篇博客

大家好,我是一名编程初学者,同时这也是我编程学习之路上的第一篇博客。在这里,我想要向大家介绍我的一些想法和规划。a.自我介绍我是一个刚刚接触编程的新手,目前在学习c语言,我对编程世界充满了强烈的好奇。当然&…

2026/7/24 0:00:29 阅读更多 →

周新闻

Go语言静态资源打包方案对比与实践指南

Go语言静态资源打包方案对比与实践指南

1. 项目背景与核心需求在Go语言开发中,我们经常需要处理静态资源文件的打包问题。无论是Web应用的模板文件、前端资源,还是配置文件、证书等,都需要随程序一起分发。传统做法是将这些文件与编译后的二进制文件放在同一目录下,但这…

2026/7/24 3:59:20 阅读更多 →
Go语言实现高性能LDAP认证服务的架构与实践

Go语言实现高性能LDAP认证服务的架构与实践

1. 项目背景与核心价值LDAP(轻量级目录访问协议)作为企业级身份认证的黄金标准,已经服务了超过80%的财富500强公司。我在金融科技领域实施统一认证体系时,发现传统Java方案存在启动慢、内存占用高等痛点。而Go语言凭借其协程并发模…

2026/7/24 1:23:39 阅读更多 →
【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

【AI面试官实战指南】:用ChatGPT模拟10类高频技术岗面试,3天提升应答精准度92%

更多请点击: https://intelliparadigm.com 第一章:AI面试官实战指南的核心价值与适用场景 AI面试官并非替代人类HR的“黑箱工具”,而是以可解释、可审计、可迭代的方式,赋能招聘全链路的关键基础设施。其核心价值在于将主观经验沉…

2026/7/23 17:49:47 阅读更多 →

月新闻