自己动手写skills:认识experience-forge,让你的 agent 自我进化 id: “051”title: 自己动手写skills认识experience-forge让你的 agent 自我进化lang: zhkeywords: [Claude Code, Agent Skills, 经验蒸馏, 长期记忆, 自我进化]abstract: 解剖我自己写的自进化 skill「experience-forge」为什么写、四个设计机制、六步蒸馏工作流、能解决什么问题并引导你装起来用——让 agent 把属于你的经验沉淀下来下次会话直接继承。status: donedate: 2026-08-28updated: 2026-08-28tags: [skills, experience, self-evolution, claude-code]引言下午三点我终于把那个环境问题改对了——第三轮。第二天换个项目同一个坑我又原样踩了一遍。类似的事我经历太多。花了不少口舌让它记住用 pnpm 不用 npm可每次新开会话它都像第一次听说一个改了八遍才定下来的设计决策关掉会话就跟着蒸发。会话一结束经验就清零。一个五百亿参数的助手却只有七秒记忆——这不合理。我给自己写了个 skill 叫 experience-forge经验锻造炉干的事一句话在解决问题的时刻判断「这次经验值不值得沉淀」经你确认后蒸馏成结构化知识、分轨入库让下一次会话直接继承。这篇和您一起分享这个experience-forge经验锻造炉skill的来由我为什么写、四个设计机制、六步工作流、能解决什么问题、你怎么装起来用。它是我写的 skill 里最「工具」的一个也是《自己动手编写 skills让你的知识可以生根发芽》那篇方法论最完整的一次落地。为什么写不满足于工具想要一个会成长的伙伴先把痛点说具体别停在「它会忘」这种抱怨上。第一个是重复踩坑。环境问题、版本问题、未文档化行为——这类坑的共同点是根因不直观一次改不对得靠试错一点点逼近。我花了三小时摸清一个坑的因果这个知识不该在下一次会话里被清零。第二个是反复交代偏好。技术栈、工具习惯、编码风格每次新会话都要重新讲一遍。教会它用 pnpm 不用 npm费不少口舌可它每次都像第一天上班。第三个是设计决策蒸发。一个方案为什么这样定、当初排除了哪些选项这些是踩过坑才有的隐性知识。代码注释不会写会话一关就没了。分析下来**问题不在模型不够聪明在于它不记得你。**模型的能力是大家的但「你在用什么栈、你踩过哪些坑、你的取舍标准」是你自己的这部分不该每次从零教。思路也不复杂把经验变成结构化、可复用的知识而不是一次性的对话记录。整段对话塞回上下文行不通——那只是把历史重放一遍烧 token 又没有泛化。经验必须是蒸馏过的、能迁移到新场景的规则。写它之前我先做了个对照。2026 年「自进化 skill」不是新概念主流做法越来越往全自动走UniM0cha 的 self-improving-skills 在后台静默蒸馏你甚至看不到它什么时候写的Hermes 的 /learn 一条命令把经验固化成技能skill-evolution 用 GEPA 式进化自动生成改技能候选、改完给人批 diff。连最克制的一档方向也是「让 AI 自己写记忆」。**全自动听起来酷但长期记忆污染成本极高。**一条错的、或被注入的指令一旦固化进~/.claude会在每个后续会话里反复生效——把一次性错误升级成永久性错误。所以 experience-forge 把「写闸门」留在用户手里评分 → 草拟 → 逐条确认 → 落库绝不静默写入。这个差异是整套设计的灵魂后面每个机制都是它的影子。先卖个关子设计里还有一个我刻意不做的选择最可靠的提醒机制我偏偏没用讲到「提醒」那节我揭晓为什么。怎么设计四个机制先给全貌。整个系统是一条闭环解决问题 → 检测信号 → 温和提醒 → 蒸馏经验用户确认→ 分类入库 → 下次自动生效。画成图画完这张图四个设计决策就浮出来了时机决定记什么、分层决定放哪、提醒决定何时开口、进化决定怎么长。我逐个拆。时机不是所有经验都值得记先讲为什么要有评分。经验不是记越多越好——记录一百条噪音之后AI 分不清哪些是规则、哪些是流水账信噪比崩塌。记忆的边际价值递减所以必须先判断「值不值得记」。我把判断压成一张打分表信号权重同一问题反复修改 ≥2 轮才改对3最强用户明确表达偏好 / 纠正3直接进画像根因不直观环境 / 版本 / 未文档化行为2可复用的好设计决策2笔误、纯 CRUD、文档已有记载0不触发≥3 分才建议沉淀≥5 分向用户强调价值。低于线的一律不打扰。为什么「反复修改」是最强信号我压成一句话**编辑重试次数约等于失败成本。**改 N 轮才改对意味着踩中了知识盲区、付出了真实时间成本——这是成本驱动的信号几乎不会误报。而且这类坑的根因往往能迁移到未来场景环境坑、版本坑换个项目还会再踩。笔误完全相反不可迁移记了只会制造噪音。评分本质是在估计这条经验的未来期望收益。这里有个「打扰预算」的概念值得记住提醒的价值由命中率决定宁可漏报不可误报。每会话最多主动建议一次被拒绝就不再提连续拒绝两次还会主动把「降低建议频率」写进画像。分层按生效范围分四轨记什么想清楚了下一个问题是放哪。这决定它什么时候、在哪个上下文里被加载。我的原则一句话**知识按生效范围分类别把每条经验都塞进同一个口袋。**把「用户偏好 pnpm」这种项目级知识存在用户级记忆里全项目都跟着噪音反过来把项目专属的坑放进用户级记忆会污染别的项目。所以按「生效范围」切成四轨四轨的加载策略各不相同用户画像全局 引入所有项目都看得到所以条目必须克制个人通用经验全局只 引入索引具体条目按需读省上下文行业领域经验独立成 skill靠领域描述匹配触发同领域项目才加载项目经验内联进项目 CLAUDE.md天然只在当前项目生效。存储一律用中立 Markdown不绑任何工具格式。这不是偷懒是适配器模式将来接 Cursor 等工具只写一个「CLAUDE.md → Cursor rules」的同步层存储层零改动。有个细节值得单独说**索引-内容分离。**上下文窗口是硬预算如果每攒一条经验就把全文塞进 CLAUDE.md几十条后全局上下文就被记忆吃光了。所以常驻上下文的只有一行索引主题 一句话 指针细节存在磁盘上的主题文件里命中索引才 Read。这就是「内存只有索引磁盘才有细节」——跟你电脑的分页表一个道理。提醒skill 是「被动」的怎么让它主动开口这是最绕的一个问题我多花点篇幅。Claude Code 的 skill 本质是一份被动文档——靠 description 语义匹配触发它只会「等被加载」不会主动监控会话。「解决完问题自动提醒」这个需求恰恰是要一个被动的东西主动开口。我有两个办法外加一个我刻意不用的办法。**全局规则兜底。**安装时在全局 CLAUDE.md 里写一段「经验蒸馏提醒」规则满足「反复修改 ≥2 轮 / 踩不直观坑 / 做了好设计 / 你表达了偏好」之一且本会话没提醒过用一句话建议运行 experience-forge。全局 CLAUDE.md 每个会话都加载规则永远在场。**description 语义触发。**skill 的 description 写清触发场景Claude 感知到「刚解决难题 / 多次返工」时自动加载完整蒸馏工作流。规则轻、流程重各司其职规则保证「该提醒时必然提醒」description 保证提醒之后有完整流程可走。现在兑现开头那个关子**最可靠的提醒机制其实是 Stop hook。**settings.json 里配一个 Stop hook每一轮结束都能注入提醒还能统计这轮返工了几次——可靠性拉满是唯一能「原生监控会话」的机制。那我为什么不用因为它每轮都响。可靠性高到什么程度打扰度就高到什么程度——可靠性与打扰度是互换的你不可能既要它每轮都提醒又要它不烦人。用户装上一周被吵烦了要么关掉 hook要么关掉整个 skill可靠性归零。v0.1 我选择「规则兜底 描述执行」规则永远在场兜住「该提醒时必然提醒」description 负责加载完整流程。打扰度压到最低可靠性由常驻规则托底。Stop hook 不是放弃是留给 v0.3——设计成按返工次数判断、非每轮响。到那时它才是「最可靠 不打扰」的合体。这个取舍值得记一条经验提醒机制的设计本质是在打扰预算里分配可靠性。进化三层自我进化第四件事是「怎么长」。这套系统不是只进不出它自己有成长结构我拆成三层经验进化经验库随每次蒸馏增长下次会话自动加载生效画像进化用户画像随观察增量精确服务越来越贴合元进化连「如何更好地蒸馏经验」本身也能被经验反哺——蒸馏出的经验如果属于「如何更好地蒸馏」比如某信号误报率高、某模板字段冗余经确认后直接更新 skill 自己的 SKILL.md 和 templates.md。前两层是对象级进化自动发生第三层是元级进化是这套系统最「自指」的地方。画出来是这样元级闭环的意义在于评分标准、模板字段不是一次定死的而是可被使用反馈修正的。当某信号误报率高、某字段冗余时它们会作为经验回灌进 skill 本体。这套系统不是记忆仓库是会自我调参的进化引擎——v0.1 的调参还要人确认但方向已经立住了。把流程走一遍六步四个机制讲完落到操作上是一条六步工作流。用户同意蒸馏后它按这个顺序走今天我蒸馏了一条经验正好拿它走一遍。坑来自 Hermes 工程化实战系列第 9 篇《生产化——安全审计与运维》里那个pip 装的 Hermes 版本落后update --check永远显示 up to datesecurity audit 报的漏洞就地修不了。回看——问题一句话update 说 up to date但版本明显落后。弯路来回怀疑自己的操作。根因官方已经把 pip 从支持渠道划掉渠道不再接收更新评分——根因不直观2加反复排查才定位3≥5 分值得记还要向用户强调价值草拟——一条个人通用经验按模板写出场景 / 症状 / 根因 / 正确做法 / 通用规则确认——把草稿给你看确认 / 修改 / 放弃落库——并入个人通用经验库的 ai-tool-install-channel.md并在索引 README 登记一行闭环反馈——一句话告诉你写到了哪、下次什么场景会自动生效。落库后的条目长这样格式是真实的我摘了字段### AI 工具安装渠道的「假 up to date」陷阱 - 分类: 个人通用 - 场景: 用 pip/brew 等第三方渠道安装 AI 工具后想升级或查安全漏洞 - 症状/问题: update --check 永远显示 Already up to date但版本明显落后、官方已发新版本security audit 报的漏洞就地修不了 - 根因: 官方已把 pip/PyPI或 brew从支持渠道划掉该渠道不再接收更新update 检查的是已装渠道的源渠道不更新源上就永远是旧版 - 正确做法: 安装前查官方 platform-support 文档确认渠道是否仍受支持发现 up to date 但版本落后时不怀疑自己去查官方支持渠道清单换 shell installer/Desktop/Docker/Nix 等官方渠道重装 - 通用规则: 凡 AI 工具报 up to date 但官方已发新版一律先查官方 platform-support 确认安装渠道是否被废弃再决定是否换渠道重装 - 来源: 2026-08-28 · Hermes 工程化实战系列 H8 · pip 装的 Hermes v0.19.0 卡在上游不再推送的渠道security audit 漏洞修不了注意模板里两个字段是检索的关键「场景」 触发条件让未来的 AI 判断这条经验适不适用「通用规则」 一行可执行直接告诉它「怎么做」不是一篇「为什么这么做」的论文。这对应《自己动手编写 skills》那篇讲的渐进披露——经验入库时就把最该被执行的句子提炼出来。今天我还顺带蒸了第二条Hermes cron 输出按 job id 分目录来自 Hermes 工程化实战系列第 8 篇《调度》的坑。两条都走同一套流程全程我确认过草稿没有一条是它静默写进去的。能解决什么问题四个收益都是我实际体会到的。**同类坑不二进宫。**环境、版本、未文档化行为这类坑根因通常跨项目可迁移。记录一次全项目通用。今天那条「假 up to date」经验落库后下次再遇到update说 up to date 但版本落后它第一时间会去查官方 platform-support而不是跟我一起怀疑人生。**AI 越用越懂你。**技术栈、风格、偏好自动沉淀新开会话不用重新交代背景。画像只增量合并、不重写你明说的算强信号直接采纳观察推断的标注置信度——它清楚自己哪些是「确定知道」、哪些是「猜的」。**好设计被留存复用。**可复用设计决策 2到了阈值就沉淀成通用规则下次同类场景直接套。不再「此灵感只应天上有人间能得几回闻」。**跨项目服务。**个人经验跟着你走项目经验留在项目里行业经验在同领域项目间复用各得其所。这是四轨的意义该生效的地方生效不该生效的地方不污染。再泼一句实话这不是银弹。它记住的是「你确认过的经验」不是你脑子里所有东西。你的隐性知识要靠你点头才会进库——这既是局限也是它敢往长期记忆里写东西的底气。装起来试三分钟上手技能包获取方式关注[GIS掌柜]微回复“experience-forge”获取下载地址。下载完成后放到你的全局或项目skills目录下装完重启就生效了。它的工作方式两种自动建议满足条件时Claude 用一句话问「这个经验值得沉淀要总结吗」——每会话最多一次手动触发直接说「总结经验 / 记录一下 / 复盘」跳过自检直接进工作流。维护也可以说人话「整理经验」会扫描四轨归并相似条目、给过时条目打 ⚠️ 标注不删除保留审计。现在你身边大概已经坐着一条值得沉淀的经验了——它可能就是你这次会话里刚改对的那个问题。等它开口问你的那一刻是一个有点奇妙的瞬间工具第一次开始记住你。写在最后这条路终点是 agent 自己长出 skills一句话总结agent 的自我进化不是让模型变强是把每次会话里「属于你」的那部分经验用你确认过的、分好类的方式存下来让下一次会话直接继承。这套系统的边界我也划清楚它现在记住的是经验条目和画像还没到「自己写 skills」那一步。但元进化那层已经埋了引线——连「如何更好地蒸馏」都能回灌规则再往前走一步就是根据积累的经验自己长出新的 skills。Hermes 工程化实战系列第 5 篇《学习闭环——技能怎么从经验里诞生》里我拆过 Hermes 怎么用 /learn 把一套跑顺的流程固化成技能、curator 怎么在后台维护技能库——那是一种更自动的自我进化。experience-forge 走的是另一头先保证每条写入都被确认保证长期记忆不被污染等数据足够干净自动化的步子才迈得出去。两条路不是谁对谁错是同一件事的两端。AI 工具的最终形态不是更强的模型而是更懂你的助手。模型的能力是大家的经验与默契是你自己的。今天就自己动手装起来试一试吧~

相关新闻

最新新闻

给AI系统装上可控刹车:模型评估、红队测试与网关护栏实战

给AI系统装上可控刹车:模型评估、红队测试与网关护栏实战

围绕“暂停AI开发”的讨论,最近热度不低。很多非技术读者把它看成要不要禁止某项技术的争论,但如果你正在负责大模型应用、Agent 工作流、API 接入层或者本地模型部署,你会意识到这场讨论真正有价值的不是“停不停”,而是“AI系统…

2026/8/29 16:41:59
DACRI:决策感知因果干预排序,重构关键供应链优先级

DACRI:决策感知因果干预排序,重构关键供应链优先级

这篇论文解读的标题是:DACRI: Decision-Aware Causal Intervention Ranking for Critical Supply Chains先说结论:这不是一篇“换个数据集刷点”的排序论文,而是一套把因果干预和决策感知塞进关键供应链节点排序流程的完整方法论。关键供应链…

2026/8/29 16:41:59
基于OMRON视觉模块的洁净服穿戴合规检测与风淋室联动方案

基于OMRON视觉模块的洁净服穿戴合规检测与风淋室联动方案

干过无尘车间改造的人应该都有这种体会:真正让车间主管头疼的,往往不是设备精度不够,而是人的因素。洁净服没拉严、帽子没戴正、袖口露出来一截——这些细节看似小事,却是半导体、医药、食品行业审核时的高频不合格项。OMRON最近发…

2026/8/29 16:41:59
IEEE33节点潮流计算:配电网稳态分析的工程标尺

IEEE33节点潮流计算:配电网稳态分析的工程标尺

简介:潮流计算是电力系统稳态分析的核心基础,本质是求解非线性代数方程组,用于确定节点电压、支路功率与网络损耗。其技术价值在于支撑电压合格率评估、无功优化、分布式电源并网可行性验证等关键工程决策。典型应用场景涵盖中压配电网规划、…

2026/8/29 16:41:59
【Codex】用学生生活日常模块记录校园生活过程

【Codex】用学生生活日常模块记录校园生活过程

学生生活日常记录学生每天的睡眠、运动、饮食、屏幕使用、情绪和压力,是班主任观察学生状态波动的重要依据。它与稳定生活画像不同,关注的是按日期持续更新的过程数据。 本文基于 StudentLifeDaily 的模型、视图和 fast-crud 页面,把学生选择…

2026/8/29 16:41:59
类脑互补视觉芯片天眸芯:重新定义端侧AI感知架构

类脑互补视觉芯片天眸芯:重新定义端侧AI感知架构

过去几年,自动驾驶、无人机和机器人的视觉系统一直在“算法大战”里内卷:检测模型换了一代又一代,算力越堆越高,可真正跑到开放世界时,仍然会遇见几个让人头皮发麻的瞬间——车辆刚出隧道,摄像头画面一片惨…

2026/8/29 16:36:59