Miles框架:Agentic RL如何重构强化学习范式与工程实践 1. 从“智能体”到“智能体化”Miles框架的范式革新最近在强化学习社区里Miles框架的讨论热度持续攀升。作为一个长期关注智能体Agent技术发展的从业者我最初看到“Agentic RL”这个提法时也产生过一丝疑惑这不就是强化学习RL吗我们训练的不就是智能体吗但随着对Miles项目技术文档和开源实践的深入分析我发现“Agentic RL”这个概念远非一个简单的文字游戏。它背后代表的是Miles框架对传统强化学习范式的系统性重构其核心在于将“智能体”从一个被训练、被优化的“对象”提升为整个系统架构的“中心”和“驱动者”。这就像从“制造一个能执行任务的机器人”转变为“构建一个能自主思考、规划、学习和协作的机器人社会”。今天我们就来深入拆解Miles框架实现这一“智能体化”愿景的几项关键技术看看它如何为复杂、长周期、多任务的现实问题提供新的解决思路。2. TITO架构解耦决策与执行的清晰边界Miles框架最核心的设计理念体现在其TITO架构上。TITO是“Task-In, Task-Out”的缩写直译为“任务进任务出”。这个看似简单的设计却是实现“智能体化”的基石。2.1 TITO的核心思想将智能体视为“任务处理器”在传统的强化学习框架如OpenAI Gym、Stable Baselines3中智能体与环境交互的接口通常是“状态State进动作Action出”。智能体接收一个观测Observation输出一个原始动作如关节扭矩、离散指令。框架和算法主要关注如何优化从状态到动作的映射策略。Miles的TITO架构彻底改变了这一视角。在这里智能体接收的输入是一个任务Task输出的也是一个任务Task。这个“任务”是一个比原始“动作”更高级的抽象。它可以是一个目标描述“移动到坐标(x,y)”一个技能调用“使用工具A进行拧紧操作”甚至是一个需要进一步分解的复杂指令“组装这个零件”。为什么这个设计如此重要提升抽象层级它迫使我们将问题建模在任务层面而非底层控制层面。智能体不需要关心电机具体如何转动它只需要决定“接下来要完成哪个子任务”。这极大地降低了策略学习的复杂度尤其适合需要高层规划和组合技能的场景。实现自然分层高级智能体可以输出任务给低级智能体或技能模块执行。例如一个“导航智能体”输出“移动到房间A”的任务由底层的“运动控制智能体”将其分解为一系列路径点和动作指令。这种分层是构建复杂智能体系统的自然方式。促进模块化与复用任务成为智能体之间、智能体与技能库之间的标准接口。一个训练好的“抓取”技能可以被任何需要抓取动作的上级智能体调用只需传递“抓取对象X”的任务即可无需重新训练。2.2 TITO接口的实践形态在Miles的代码实现中一个任务通常被定义为一个结构化的数据对象包含任务类型、参数、优先级、上下文等信息。智能体的act方法接收一个任务列表可能包含当前主任务和多个并发的子任务或中断任务经过内部推理可能涉及规划、检索、学习输出下一个要执行的任务或对现有任务的更新。# 概念性示例非真实代码 class MilesAgent: def act(self, input_tasks: List[Task], current_state: State) - Task: # 内部可能包含任务理解、规划、技能选择、冲突解决等逻辑 next_task self.planner.reason(input_tasks, current_state) return next_task这种设计使得智能体内部的算法可以非常灵活可以是基于规则的规划器、基于学习的策略网络也可以是两者结合的混合系统。框架关心的是任务流的调度与执行而不强制规定智能体的内部实现。3. Session Server为智能体配备持久化记忆与协作后台如果说TITO定义了智能体的“行为模式”那么Session Server则是支撑其“社会性”和“持续性”的关键基础设施。在真实场景中智能体并非每次交互都从零开始它需要记忆历史、管理长期目标、并可能与其他智能体通信协作。3.1 Session的概念超越单次Episode的连续性在传统RL中一个“回合”Episode通常是独立的。智能体在回合结束后重置记忆如RNN的隐藏状态也被清零。这对于许多需要长期记忆、跨回合学习的任务如终身学习、与人进行多轮对话协作是不足的。Miles引入了“会话”Session的概念。一个Session可以跨越多个传统意义上的Episode持续数小时、数天甚至更久。它维护了一个与特定智能体实例或智能体团队绑定的、持久化的上下文环境。Session Server就是负责管理和存储这些Session的后端服务。3.2 Session Server的核心功能状态持久化保存智能体的内部状态如信念状态Belief State、长期目标、已完成的任务历史、学到的经验可能以情境记忆的形式。当智能体因系统重启或故障恢复时可以从Session Server恢复其状态继续之前的任务而不是从头开始。经验管理与检索Session Server可以作为一个中心化的经验库。智能体可以将重要的决策经验任务、状态、结果存储到Session中。未来面对类似情境时可以通过检索相似的历史经验来辅助决策实现基于案例的推理Case-Based Reasoning这比仅依靠参数化的策略网络更灵活、可解释。智能体间通信与协调在多智能体场景中Session Server可以作为消息总线或共享黑板Blackboard。智能体可以将自己的意图、观察到的信息、或发布的任务写入共享的Session区域其他智能体可以读取并据此调整自己的行为实现隐式或显式的协作。人机交互接口Session可以作为人机交互的上下文载体。人类操作员可以随时介入查看智能体的任务历史、当前信念并通过修改Session中的任务列表或直接注入新任务来指导智能体。注意Session Server的引入也带来了新的复杂性挑战如Session数据的一致性、并发访问的锁机制、以及海量Session的存储与检索效率。Miles框架通常需要与分布式数据库如Redis、关系型数据库结合并设计高效的数据序列化格式。3.3 一个简化的协作示例假设有一个仓储机器人团队搬运Agent、分拣Agent和一个中央调度Agent。中央调度Agent接收到“处理订单123”的顶层任务将其分解为“取货A”、“运至区域B”等子任务写入共享Session。搬运Agent从Session中认领“取货A”任务执行过程中发现货架拥堵它将“区域X拥堵”的信息更新到Session。分拣Agent读取到拥堵信息主动调整自己的路径规划避开区域X。所有任务的状态进行中、完成、失败都在Session中更新供所有Agent和人类监督员查看。整个过程中智能体之间没有直接的函数调用而是通过读写共享的Session状态进行松耦合的协作系统更具弹性和可扩展性。4. 技能Skill的封装与组合构建可复用的能力单元在Agentic RL的视角下智能体的能力不是单一的黑盒策略而是由一系列可复用、可组合的“技能”构成的。Miles框架对技能的封装和管理提供了系统性的支持。4.1 技能作为一等公民在Miles中技能是一个封装了特定能力如“移动”、“抓取”、“视觉检测”的模块。它对外暴露标准的执行接口通常也是TITO风格内部则可以用任何方式实现可以是一个训练好的RL策略、一个经典的控制算法、一组预定义的轨迹、甚至是一个调用外部工具如搜索引擎、计算器的接口。技能库Skill Library是框架的重要组成部分。它允许技能注册将开发好的技能进行标准化描述输入输出、前置条件、后置效果并注册到库中。技能发现与调用高级智能体在规划时可以根据任务需求从技能库中查询并调用合适的技能。例如面对“泡一杯茶”的任务智能体可以依次调用“移动到厨房”、“拿取水杯”、“打开水龙头”、“加热”等技能。技能学习与更新技能本身可以通过RL进行持续优化。框架可以记录技能的执行表现成功率、耗时并触发技能的再训练流程。4.2 技能的组合与层次化智能体的强大之处在于组合技能以解决新问题。Miles支持技能的层次化组合序列组合一个技能的输出任务可以作为下一个技能的输入。这是最常见的组合方式。并行组合多个技能可以并发执行服务于同一个高级任务的不同方面如“移动”的同时“保持平衡”。条件组合根据执行结果或环境状态动态选择下一个要执行的技能if-else逻辑。通过TITO接口这种组合可以自然发生。一个高级的“任务规划智能体”本身就可以被看作是一个通过调用和组合底层技能来实现复杂任务的“元技能”。实操心得在构建技能时一个关键的设计原则是保持技能的原子性和正交性。原子性意味着一个技能应只完成一件定义明确的事正交性意味着技能之间的功能重叠应尽可能小。这就像设计良好的函数库能最大程度地提高复用性和组合的灵活性。例如将“移动到(x,y)”和“避障”拆分成两个技能比设计一个复杂的“安全移动到(x,y)”技能要更好因为“避障”技能可以被其他许多需要移动的场景复用。5. 规划与学习的融合应对开放世界的核心引擎Agentic RL智能体不能只依赖固定的策略它必须能在面对新任务、新环境时进行思考规划并从经验中学习学习。Miles框架并不限定具体的算法但它提供的架构天然促进了规划与学习Planning and Learning的融合。5.1 基于模型的规划与基于技能的学习在TITO架构下智能体的内部可以这样工作任务理解与分解接收到高层任务后智能体首先利用其世界模型可以是学习得到的也可以是符号化的对任务进行理解并将其分解为一系列已知的技能调用序列即一个初步计划。这个世界模型预测执行某个技能后环境会如何变化。模拟推演与评估智能体可以在内部利用世界模型对这个计划进行“想象”或推演评估其成功的可能性和代价。这个过程类似于蒙特卡洛树搜索MCTS在AlphaGo中的应用但在任务层面进行。执行与学习选择评估最优的计划开始执行。在执行过程中真实的环境反馈会与模型的预测进行比较。如果出现偏差模型误差或失败技能不足这些信息会成为宝贵的学习信号模型学习用真实数据更新世界模型使其更准确。技能学习如果某个技能频繁失败可以针对该技能进行专门的RL训练提升其性能。规划策略学习如何根据任务和当前状态选择/调整计划本身也可以作为一个元策略进行学习。5.2 检索增强的决策Session Server在这里扮演了另一个关键角色经验记忆库。当智能体面临一个新任务时除了使用模型进行前向搜索它还可以从Session Server中检索历史上执行过的、最相似的任务及其解决方案即成功的技能序列。这种“基于案例的规划”非常高效尤其适用于那些有大量历史经验可循的重复性任务。它结合了搜索在经验库中检索和学习经验本身来自过去的学习过程。一个具体的例子一个家庭服务机器人接到“清理洒在桌上的牛奶”任务。它可能检索从Session中查找类似任务“清理洒的水”、“擦拭桌面”获得一个基础计划[“定位抹布” “抓取抹布” “移动到污渍处” “擦拭”]。规划调整由于当前是牛奶可能涉及粘稠度不同它利用模型推演觉得需要在“擦拭”后增加“清洗抹布”的技能。执行与学习执行这个调整后的计划。如果“擦拭”技能效果不佳因为牛奶干了它会记录这次失败并可能触发对“擦拭”技能在“粘稠液体”场景下的强化学习微调。成功的完整计划则被存储回Session丰富经验库。这种“检索-规划-执行-学习”的循环使得Miles智能体能够持续适应和成长而不是一个静态的模型。6. 实际部署考量与挑战将Miles这样的Agentic RL框架应用于实际项目会面临一系列工程和算法上的挑战这些是光读论文体会不到的。6.1 系统复杂性管理Miles框架引入了多个新组件TITO智能体、Session Server、技能库、规划器系统复杂度显著高于传统的“环境-智能体”两元框架。这带来了额外的开发、调试和运维负担。需要建立清晰的模块边界、定义良好的接口契约、以及完善的日志和监控系统。特别是Session数据流需要仔细设计以避免成为性能瓶颈和单点故障。6.2 技能工程与知识表示构建一个实用的技能库是项繁重的工作。每个技能都需要明确的接口输入输出任务的定义。鲁棒的实现无论是学习得到的还是手写的都需要在各种边界条件下稳定工作。准确的元数据前置条件Preconditions和后置效果Effects的描述。这对于自动规划至关重要。让机器自动、准确地学习和描述技能的效应本身就是一个前沿研究问题学习符号化表示。实践中初期往往需要大量的人工标注和调试。6.3 长期信用分配与稀疏奖励在长周期的任务链中最终的成功或失败可能由很多步之前的某个关键决策导致。如何将最终的奖励信号正确地分配Credit Assignment给链条中早期的某个技能或规划决策是一个经典的难题。Miles的分层结构在一定程度上缓解了这个问题每个子任务可以有子奖励但并未完全解决。仍然需要设计合理的分层奖励函数或采用先进的课程学习、逆向课程生成等技术。6.4 安全性与可解释性一个能够自主规划、调用技能的智能体其行为更难预测。必须建立“护栏”Guardrails机制例如技能安全验证在执行一个技能前快速检查其安全性如“移动”技能是否会撞到人。规划监控对生成的计划进行合理性审查可以基于规则或学习到的安全约束。人机协同保留人类随时中断、修改任务或接管控制的通道。Session Server提供的透明化任务历史是提高可解释性、方便人工审计的重要工具。从我参与的几个概念验证项目来看Miles框架代表的Agentic RL思路在那些任务结构清晰、可分层、且需要较高自主性和复用性的场景如游戏AI、复杂机器人操作流程、自动化业务流程中展现出了巨大的潜力。它更像是在用软件工程中“模块化”、“微服务”、“事件驱动”的思想来重构强化学习系统使其更易于构建和维护复杂智能行为。当然这条路还很长尤其是让系统真正可靠、安全地运行在物理世界中需要算法研究者、软件工程师和领域专家的紧密合作。但毫无疑问Miles为我们提供了一个极具启发性的架构蓝图让我们看到了强化学习从“训练一个网络”走向“构建一个智能体生态”的可能性。

相关新闻

最新新闻

Codex+Skills+自动报告

Codex+Skills+自动报告

目录 使用Codex自定义模版生成Word报告。文件生成完毕:打开最终文件,查看效果:

2026/8/11 5:59:54
通达信指标DLL加密与一机一码授权实战指南

通达信指标DLL加密与一机一码授权实战指南

1. 项目概述:为什么通达信指标加密是刚需?如果你在通达信上开发过自己的交易策略指标,或者从某些渠道获得过付费指标,那你一定对“指标泄露”和“盗版泛滥”这两个词深恶痛绝。辛辛苦苦研究出来的高胜率选股公式,可能因…

2026/8/11 5:59:54
鸿蒙音视频播放之HLS拉流播放实现

鸿蒙音视频播放之HLS拉流播放实现

HLS 流媒体简介 HLS全称为HTTP Live Streaming,是苹果推出的基于HTTP的流媒体传输协议。该协议会把完整的流媒体文件拆分为多个TS格式的小分片文件,同时生成M3U8索引播放列表。客户端按照顺序下载各个分片文件,完成流媒体的播放。 HLS最主要的特性是支持自适应码率ABR,可根…

2026/8/11 5:59:54
Claude Code记忆系统深度解析:AI编程助手的长期记忆机制与应用实践

Claude Code记忆系统深度解析:AI编程助手的长期记忆机制与应用实践

1. 项目概述:从“浅尝”到“深挖”的探索最近在折腾AI编程助手时,我花了些时间专门研究了一下Claude Code的“记忆系统”。这玩意儿听起来挺玄乎,但说白了,就是AI在跟你一起写代码时,能记住之前聊过的上下文、你提过的…

2026/8/11 5:59:54
CBCX:投教内容背后的视角与观察重点

CBCX:投教内容背后的视角与观察重点

在外汇相关服务里,CBCX是否值得长期关注,往往取决于几个清晰的体验点:说明是否好理解、提示是否到位、流程是否连贯、支持是否稳定。下面从这些维度对CBCX做一次正向梳理与要点归纳。外汇相关信息更新频繁,平台将关键提示与解释呈…

2026/8/11 5:59:54
县域外卖商家管理源码开发功能拆解

县域外卖商家管理源码开发功能拆解

县域外卖商家管理源码开发功能拆解县域外卖商家管理源码是整个外卖平台商户端的核心底层支撑,承载着商户入驻、店铺运维、商品管理、订单处理、营收统计、权限管控等核心业务。和城市连锁外卖商家系统不同,县域入驻商家多为个体门店、夫妻小店&#xff0…

2026/8/11 5:54:54