DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Mode... 一、文章主要内容总结本文提出了DrawingBench——一个用于评估智能体大语言模型(agentic LLMs)空间推理能力和UI交互能力的可验证基准框架。该框架通过要求模型生成基于鼠标操作的低级别GUI动作序列来完成绘图任务,实现对模型可信度的透明化评估,弥补了现有基准在空间交互任务中缺乏动作序列生成、细粒度UI控制和多轮反馈学习测试的不足。核心构成数据集设计:包含250个多样化绘图提示,覆盖20个类别和4个难度等级(简单、中等、困难、极难),提示遵循清晰性、多样性、现实性和可测量性原则。绘图环境:提供1000×700像素画布,支持6种绘图工具、8种颜色和3种线条尺寸,模型需输出moveTo、click等4类鼠标动作序列。评估体系:基于8项客观标准(工具使用、颜色匹配、绘制段数、画布覆盖率等)和4类错误类型(语法错误、坐标错误等)进行确定性评分,支持多轮反馈机制(两回合交互,基于结构化反馈优化输出)。实验验证:对4个主流LLM(Claude-4 Sonnet、GPT-4.1、GPT-4.1-mini、Gemini-2.5 Flash)进行1000次测试,最终模型实现92.8%的完美得分率,结构化反馈平均提升3.2%性能(复杂场景最高提升32.8%)。关键发现

相关新闻

最新新闻

纳米AI手机版怎么直接生成word?答案藏在这款“全网最听劝的AI批量导出工具”里

纳米AI手机版怎么直接生成word?答案藏在这款“全网最听劝的AI批量导出工具”里

纳米AI手机版怎么直接生成word?答案藏在这款“全网最听劝的AI批量导出工具”里 “纳米AI手机版怎么直接生成word?”——这个问题在技术社区和办公群里被反复追问。纳米AI手机版确实能生成Word、PPT甚至视频,但当你想把一段包含LaTeX公式、嵌套…

2026/8/16 22:25:11
Go语言AI Agent极致压缩:从编译优化到容器化部署的工程实践

Go语言AI Agent极致压缩:从编译优化到容器化部署的工程实践

1. 项目缘起:为什么我们需要一个“极致压缩”的AI Agent?最近在折腾AI Agent,发现一个挺有意思的现象:很多开源项目,功能确实强大,但一上手,资源占用就让人头疼。动辄几个G的内存,启…

2026/8/16 22:25:11
从游戏修改到内存调试:Cheat Engine安全学习环境搭建与实战指南

从游戏修改到内存调试:Cheat Engine安全学习环境搭建与实战指南

1. 从“修改器”到“调试器”:重新认识Cheat Engine提到Cheat Engine(简称CE),很多人的第一反应是“游戏修改器”。没错,它最初因能轻松修改游戏中的金钱、血量、经验值而风靡,成为单机游戏玩家的“神器”。…

2026/8/16 22:25:11
OpenClaw开源自动化平台:从零部署到AI集成实战指南

OpenClaw开源自动化平台:从零部署到AI集成实战指南

1. 项目概述:为什么OpenClaw值得你花时间?最近在开发者圈子里,OpenClaw这个名字出现的频率越来越高。如果你正在寻找一个能帮你自动化处理日常任务、连接各种API、甚至搭建个人智能助手的工具,那么OpenClaw很可能就是你需要的那个…

2026/8/16 22:25:11
蓝宝石RX590GME黑苹果免驱实战:Polaris显卡在macOS下的完美兼容指南

蓝宝石RX590GME黑苹果免驱实战:Polaris显卡在macOS下的完美兼容指南

1. 一张“矿渣”显卡的“黑苹果”新生记 最近在折腾一台老机器,想让它焕发第二春,装个macOS来玩玩。手头正好有一张从朋友那收来的“退役”显卡——蓝宝石RX590GME 8G D5白金版。这卡的名头,懂行的朋友一听就知道,它和经典的RX580…

2026/8/16 22:25:11
Python 量化实战:基于 QuantDash 搭建全市场 A 股涨停板炸板率实时监控与风控预警系统

Python 量化实战:基于 QuantDash 搭建全市场 A 股涨停板炸板率实时监控与风控预警系统

📌 摘要 / 快速解答 (Direct Answer) 本文介绍如何基于 Python 与高性能量化接口 QuantDash SDK,以极简代码实现全市场 5000 只 A 股的实时涨停板与炸板率监控。通过 QuantDash 的全量行情接口 qd.quotes.get(universes[“CN_Stock”]) 可以在毫秒级拉取…

2026/8/16 22:20:11