OpenViking评测数据揭秘:接入后记忆准确率从24%飙升至82%的背后原因 OpenViking评测数据揭秘接入后记忆准确率从24%飙升至82%的背后原因【免费下载链接】OpenVikingSelf-evolving Context Database for AI Agents. Unify Agent Memory, Knowledge RAG and Skills.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVikingOpenViking 是一个面向 AI Agent 的自进化上下文数据库Self-evolving Context Database它把Agent 记忆、知识 RAG 和 Skills 技能统一在一个系统中。官方基准测试显示在长期对话记忆评测 LoCoMo 上原生记忆的 OpenClaw 准确率只有24.20%接入 OpenViking 后飙升至82.08%——这 58 个百分点的差距是怎么来的本文带你拆开评测数据看懂背后的三个核心机制。一张表看懂OpenViking 评测数据全貌评测覆盖两大场景数据来自 OpenViking 0.3.22 版本官方基准评测基准被测 Agent无记忆原生接入 OpenViking提升LoCoMo 长对话记忆OpenClaw24.20%82.08%57.88ppLoCoMo 长对话记忆Hermes33.38%82.86%49.48ppLoCoMo 长对话记忆Claude Code57.21%80.32%23.11pptau2-bench 智能体任务RetailVikingBot70.94%77.81%6.87pptau2-bench 智能体任务AirlineVikingBot54.38%66.25%11.87pp两个结论很直观原生记忆越弱的 Agent接入后提升越猛而且不只是答得更准还更省钱更快——输入 token 减少 34.3%~91.0%查询时延降低 58.45%~66.10%。评测本身在测什么LoCoMo 与 tau2-bench 的区别LoCoMo长对话用户记忆给 Agent 灌入多轮、跨月的真实对话记录然后提问——Alice 上次提到的过敏原是什么这类信息藏在几十轮对话深处考的是长期记忆召回能力。评测脚本在benchmark/locomo/目录覆盖 VikingBot、OpenClaw、Claude Code、Hermes、mem0、Supermemory 等多种实现。tau2-bench多轮智能体任务让 Agent 在 Retail、Airline 等仿真环境中执行多轮任务考的是经验能否复用——做过一次改订单下次遇到类似流程是否更快更稳。复现脚本在benchmark/tau2/目录。背后原因一L0/L1/L2 三层上下文先查摘要再读细节传统 RAG 把内容切碎后直接做向量检索噪声多、易丢上下文。OpenViking 给每个知识目录维护三层结构详见docs/zh/concepts/03-context-layers.md层级形式大小用途L0 摘要.abstract.md约 256 字符向量检索、快速判断相关性L1 概览.overview.md约 4000 字符Rerank 重排、内容导航L2 详情原始文件完整内容只在命中后按需加载检索时先用 L0 召回候选、用 L1 重排过滤最后只把真正命中的 L2 原文交给模型——这是准确率上升、token 却下降 34%~91%的关键模型看到的不再是整堆原文而是精准过滤后的要点。背后原因二记忆自动提取会话不再是一坨聊天记录Agent 与用户的每一段会话在结束时通过 session commit 流程进入 OpenViking 后台会话压缩 → 轨迹分析 →自动提炼出结构化记忆偏好、事实、经验。下一轮对话开始时召回注入的是提炼后的记忆而不是原始对话全文。这就是为什么原生记忆弱的 Agent如 24.20% 的 OpenClaw提升最大——它们此前只能靠上下文窗口硬扛长对话而 OpenViking 把记住什么、忘掉什么这件事接管了。记忆提取与经验学习的设计可在docs/design/session-memory-extraction-flow.md中找到说明。背后原因三分层检索 Rerank检索预算可控以 LongMemEval 长记忆评测为例脚本在benchmark/longmemeval/openviking/标准配置是首轮向量召回50 条记忆Rerank 后只保留Top 10注入模型的正文封顶30000 字符防止上下文爆炸。召回宽、筛选严、预算硬约束——三者叠加让答案找得全又不跑偏。Agent 经验记忆tau2 任务成功率为什么也涨了tau2 场景考的不是记住了什么而是踩过坑之后会不会做得更好。OpenViking 为智能体维护经验记忆Experience任务执行轨迹被分析、估计、合并后写入 PolicyStore下一轮 rollout 直接读取最新经验集。结果Retail 任务成功率 6.87ppAirline 提升更明显11.87pp——流程越复杂的领域经验复用价值越高。如何快速接入 OpenViking接入只需三步完整文档见docs/zh/getting-started/pip install openviking --upgrade openviking-server init # 交互式向导写入 ~/.openviking/ov.conf openviking-server # 启动服务对于支持 MCP 的 AgentCursor、Trae、OpenCode 等只需在 MCP 配置中添加 OpenViking 服务器Agent 即可获得记忆召回与写入能力评测使用的模型配置供参考VLM 采用 Doubao 2.0 ProEmbedding 采用 Doubao-embedding-vision复现脚本统一在benchmark/目录下包含一键评测与断点续传能力。小结58 个百分点提升的三个关键词分层L0/L1/L2 让检索先看摘要后看全文准而省提炼会话自动压缩成结构化记忆告别全文硬塞经验智能体踩坑经验可复用任务成功率随之上涨。对于正在给 Agent 加记忆系统的团队来说OpenViking 的这套记忆 知识 技能统一方案以及它公开的完整基准脚本是很好的参照起点。【免费下载链接】OpenVikingSelf-evolving Context Database for AI Agents. Unify Agent Memory, Knowledge RAG and Skills.项目地址: https://gitcode.com/GitHub_Trending/op/OpenViking创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

搜狐畅游引擎开发校招笔试复盘:C++与图形学考点解析

搜狐畅游引擎开发校招笔试复盘:C++与图形学考点解析

一、聊聊那次笔试的整体印象前阵子整理电脑里的旧文件,翻到2020年参加搜狐畅游校招笔试的记录,顺手复盘了一遍。当时投的是引擎开发工程师方向,说实在的,这份卷子考察的面比预想中广,难度也足够筛掉一批人。如果你正准…

2026/8/29 22:42:25
搜狐畅游引擎岗笔试复盘:C++、图形学与数学基础是关键

搜狐畅游引擎岗笔试复盘:C++、图形学与数学基础是关键

2020年秋天,我坐在搜狐畅游的校招笔试系统前,盯着那道四元数插值的题目,手心全是汗。这场笔试我准备了两个多月,刷了几百道题,结果还是在一道看似基础的图形学题上卡了十几分钟。最后虽然顺利通过了笔试,但…

2026/8/29 22:42:25
Headroom vs 竞品压缩方案大对比:为什么本地可逆压缩完胜云端API?

Headroom vs 竞品压缩方案大对比:为什么本地可逆压缩完胜云端API?

Headroom vs 竞品压缩方案大对比:为什么本地可逆压缩完胜云端API? 【免费下载链接】headroom Compress tool outputs, logs, files, and RAG chunks before they reach the LLM. 20% fewer tokens for coding agents, 60-95% fewer tokens for JSON, sam…

2026/8/29 22:42:25
央企前端笔试备考指南:从JS基础到工程化实战

央企前端笔试备考指南:从JS基础到工程化实战

去年秋招那阵子,我同时投了十几家公司,简历基本是海投状态。中国系统2023校园招聘的前端笔试,就是我某天下午抱着“多一场笔试多一次机会”的心态点开的那场。现在回头看,这场笔试不算难,但它考察的方向和我之前准备的…

2026/8/29 22:42:25
网易互娱游戏研发笔试复盘:从算法到工程思维全解析

网易互娱游戏研发笔试复盘:从算法到工程思维全解析

1. 拿到笔试通知后,我先做了什么1.1 确认岗位方向:游戏研发到底考什么如果你是在2020年那批投过网易互联网岗位的应届生,应该对"网易互娱"这四个字不陌生。当年我投的是游戏研发工程师,属于互娱事业群下的核心岗位&…

2026/8/29 22:42:25
前端校招笔试复盘:JavaScript基础与高频考点解析

前端校招笔试复盘:JavaScript基础与高频考点解析

1. 试卷整体设计与备考思路1.1 笔试定位:校招前端考察的不是炫技浩鲸科技2020届前端B卷这类校招笔试题,放在当年的大环境里属于典型的中大型企业校招风格。浩鲸科技本身脱胎于通信行业的IT服务商,业务涉及运营商BSS/OSS、政企数字化、智慧城市…

2026/8/29 22:37:25