TTRL、PRIME原作论文讲解-智源大会2025(二) 、隐式密集奖励框架Implicit-PRM。传统RLHF通常只有结果奖励,难以获得过程监督,而Implicit-PRM通过将奖励定义为策略与参考模型对同一动作对数概率之比,只要有最终得分,就能在推理阶段为每一步甚至每个token生成免费的过程奖励。基于这样的奖励信号,团队提出了RL框架PRIME:结果奖励实时更新PRM,PRM立即反馈密集奖励,再与结果奖励合并更新策略模型。 2、Test-Time Reinforcement Learning(TTRL),最近也比较火。在没有任何人工标签的情况下,模型对同一输入采样多条答案,通过多数投票给出伪标签,再将“是否与投票答案一致”作为0、1奖励做强化学习训练。有效性来自“幸运的负奖励”现象:只要模型输出充分多样,即使真标签未知,投票也能提供方向正确、噪声可控的梯度信号。 3、The Entropy Mechanism 实验证明,在各种模型、数据和算法设置下,丁宁老师指出:高概率且高优势的动作会急剧降低熵,低概率但高优势的动作则会抬高熵。据此,只需对极少数协方差最大的token做Clip,或用KL正则约束更新幅度,就能保持探索多样性并避免熵快速坍缩,效果超过DAPO,而无需反复调参。 4、展示了在视觉-运动控制任务中的尝试:仅用一条演示轨迹和二元奖励信号,就把机器人任务成功率提升99% 以上。 5、问答环节:Clip是否引入偏差、TTRL如何避免reward hacking #大模型 #智源大会 #强化学习 #抖音精选公开课

2407
25
1554
420
举报
发布时间:2025-06-10 08:12
全部评论
大家都在搜:
...
果然是清华的,逻辑和表达都很清晰
1年前·重庆

7

分享
回复
...
[微笑] 最新的研究不是揭示了强化学习完全没有帮助到LLM?
1年前·美国

0

分享
回复
训练 AI 像打怪升级,训练人似养蛊修炼,都超有料!
4月前·江苏

0

分享
回复
很无敌
1年前·英国

0

分享
回复
第三个,就是不要做简单的事情,会变傻。得看看新世界,做未知的事情,获得巨大的挑战
1年前·广东

0

分享
回复
电子系也搞大模型,是不是全民大模型了?
1年前·上海

1

分享
回复
看头发就知道年轻
1年前·江苏

0

分享
回复
...
这东西,没有预期
1年前·辽宁

0

分享
回复
只是模仿和模式识别,不是真正的创新!没有提示,就停止进步[柴犬]
1年前·山东

0

分享
回复
有些东西无法直接给出价值,或价值判断不准
1年前·浙江

0

分享
回复
Reward工程,会是以后很大一块工作
1年前·北京

1

分享
回复
一蛙AI
一蛙AI

粉丝4.0万获赞17.3万

猜你喜欢

推荐视频

热榜推荐