初创实习-CFF-GRPO 1. 背景无论是GRPO还是PPO,都需要RM,但是RM无法迁移到corner data上,因此这种在线的方式需要进行修改,如果能完全依靠规则的方式进行奖励那就好很多了🤔(参考 GRPO 的规则奖励)我们希望在Stage3的基础之上,表现能够进一步提升;GRPO 相关链接:https://blog.csdn.net/weixin_57128596/article/details/157809869?ops_request_misc=elastic_search_miscrequest_id=1f63ad9481efb869fc7a4eac50b49b62biz_id=0utm_medium=distribute.pc_search_result.none-task-blog-2allElasticSearch~search_v3-1-157809869-null-null.541v3pc_search_result_blog2utm_term=GRPOspm=1018.2226.3001.4450PPO 相关链接:https://blog.csdn.net/weixin_57128596/article/details/163241993?ops_request_misc=elastic_search_miscrequest_id=4cedcbdcffcadf1dd3661c04f4d7fc48biz_id=0utm_medium=distribute.pc_search_result.none-task-blog-2allElasticSearch~search_v3-2-163241993-null-null.541v3pc_search_result_blog2utm_term=PPOspm=1018.2226.3001.44502 期望我们期望模型的生成考虑符号规则,如:|顶级分隔:分割JSON最外层一级字段,顺序固定不可乱,固定顺序:cats_visible | lighting | cats内容 | other_beings | interactions | environment_anomalies | summary,二级分隔:一只猫咪体内所有属性用逗号挨个隔开,顺序固定;多只猫可继续用,追加。~三级内嵌分隔:只用于nearby_anchors锚点,格式固定:anchor_type~visual_id~proximity。因此完整期望如下:符号本身、和总数应该都是固定的,需要占据高权重,对模型的梯度影响要更大;模型生成内容需要正确,即符号后面的内容也很重要;参数不要和模型原来偏离太多;3 第一版奖励设计3.1 符号定义π θ \pi_\thetaπθ​:Actor模型(带LoRA,待优化)π ref \pi_{\text{ref}}πref​:冻结参考模型(Stage2 SFT基座,无LoRA)D DD:训练数据集,单条样本 = 图像 + prompt + GT compact标注N NN:一组内候选输出总数量i ii:组内第i ii条生成样本r i r_iri​:自定义复合奖励(JSON格式分 + 视觉字段识别分 + 猫咪数量硬惩罚)A i A_iAi​:组内标准化优势函数λ sft \lambda_{\text{sft}}λsft​:SFT损失权重β KL \beta_{\text{KL}}βKL​:KL正则权重特点:只需要Actor模型、Ref模型,和传统的强化学习不一样的是,数据集是带GT的 list;过程:组内优势函数A i A_iAi​是由静态的规则决定的,不涉及 RM;3.2 损失函数(1)完整总损失公式:L total = L GRPO ( π θ ) + λ sft ⋅ L SFT ( π θ ) \mathcal{L}_{\text{total}} = \mathcal{L}_{\text{GRPO}}(\pi_\theta) + \lambda_{\text{sft}} \cdot \mathcal{L}_{\text{SFT}}(\pi_\theta)Ltotal​=LGRPO​(πθ​)+λ

相关新闻

最新新闻

React 18 核心概念与 Hooks 实战:从声明式 UI 到高效开发

React 18 核心概念与 Hooks 实战:从声明式 UI 到高效开发

1. 从“学不动了”到“快速上手”:为什么React值得你投入 前端圈子里总流传着“学不动了”的调侃,框架、工具链更新迭代的速度确实让人眼花缭乱。但如果你问我,在众多选择中,哪一个是最值得投入时间、能让你构建现代Web应用能力产…

2026/7/30 8:00:29
矩阵方程求解:从基础到工程实践

矩阵方程求解:从基础到工程实践

1. 矩阵方程求解概述 矩阵方程求解是线性代数中的核心问题之一,也是工程计算、数据分析、机器学习等领域的基础工具。简单来说,矩阵方程就是形如AXB的方程,其中A、X、B都是矩阵。这类方程在电路分析、结构力学、图像处理等实际问题中广泛存在…

2026/7/30 8:00:29
FreeRTOS嵌入式实时操作系统:从核心原理到STM32/ESP32项目实战

FreeRTOS嵌入式实时操作系统:从核心原理到STM32/ESP32项目实战

1. 项目概述:为什么FreeRTOS值得你投入时间如果你正在玩STM32、ESP32或者GD32这类微控制器,并且感觉裸机编程(也就是一个while(1)大循环)越来越力不从心,那FreeRTOS就是你绕不开的下一站。它不是什么高深莫测的黑科技&…

2026/7/30 8:00:29
FireMonkey动画开发:从弹跳小球到奔跑小人

FireMonkey动画开发:从弹跳小球到奔跑小人

1. 项目概述:FireMonkey动画开发入门十年前我第一次接触FireMonkey时,就被它的跨平台动画能力惊艳到了。作为Delphi开发者从VCL转向FMX的必经之路,动画系统是其中最令人兴奋的部分。不同于VCL时代需要手动处理GDI的繁琐,FireMonke…

2026/7/30 8:00:29
C++析构函数深度解析:三种必须自定义的场景与RAII实践

C++析构函数深度解析:三种必须自定义的场景与RAII实践

1. 项目概述:为什么析构函数值得“深入理解”?在C的世界里,构造函数和析构函数这对“生死搭档”是面向对象编程的基石。如果说构造函数负责对象的“诞生”——分配资源、初始化状态,那么析构函数就负责对象的“善后”——清理资源…

2026/7/30 8:00:29
AI语音对话与18000mAh大电池加持,Bigme发布彩色墨水屏AI电子相框F13!

AI语音对话与18000mAh大电池加持,Bigme发布彩色墨水屏AI电子相框F13!

近日,Bigme 推出全新 F13 彩色墨水屏 AI电子相框。该产品采用 13英寸 E Ink Spectra 6 彩色墨水屏,配备 18000mAh 大容量电池,并支持AI语音对话、AI语音生图,搭配Bigme相框APP,实现照片展示、艺术画廊、日历同步、天气…

2026/7/30 7:55:29

月新闻