粉丝937获赞1.8万

好的,我们现在应该已经介绍了强化学习的基本的这个问题设定和他的常用的一些术语,我们就来看一看他在大元模型的训练中 是怎么样把这些元素印设上去的。这边啊画了一个他们这个对应关系的一个图,左边是我们一般的强化学习的问题,然后右边是我们强化学习在大元模型训练中的一个应用。 首先比较简单的就是我们这个 policy 函数,它其实就是对应我们这个要训练的大圆模型的本质, 然后它的初始状态对应我们给大圆模型输入的 prompt, 或者说这个提示词。至于这个 action 其实是有两种建模方法, 它既可以把每一个这个输出的 token 单独建模成一个 action, 它也可以把整个句子或者说这个序列当做一个单独的一个 action。 同样这个 stat 其实也是比较简单,其实就是我们这个 prompt, 再加上我们已经生成的一个句子,这也就是一种 这个自回归生成的这样的一种设定。至于这个 reward, 一 般来说我们是来自于一个形式化的一个验证器,就是 very fire, 或者说一个我们用这个偏好数据来训练的一个这个 reward model。 然后右边这边也画了一个这个简单的一个图,就是我们会把大圆模型输入的这个上下文,就从这个 x e 到这个 xt 当做它的一个状态, 然后把它输出的这个 token 或者说输出的这个 sequence 当做一个 action, 然后同时呢还会有一个 reward model 或者这个 verify 给它一个标亮的这个 reward。 这边我还找了一个图,就是 把大圆模型输出的整个虚列当做一个 action 的 这样的一个建模方法,就是我们先给大圆模型一个初始状态,就是我们输入了这个 prompt, 然后大圆模型按照它的概率分布,就是我们最终输出头的这个 token 上的一个概率分布, 然后来去做他的推理的彩样,然后最终输出一个完整的这个啊 completion, 或者说这个句子,然后就是大圆模型做出的这个 action, 根据我们的 action 呢,我们会从环境中得到一个 word, ok, 下面这边是另一种这种建模方式,就是我们把单独的每个 token 当做它的一个这个 action, 同样也是给大约模型一个起始的输入 prompt, 然后它根据这个次回归去做这个 token, 一 到 token t 的 这样的一个采样,然后我们也可以根据这个中间的这个生成过程 给予每一个这个 token 或这个 action, 然后一个过程的一个这个奖励。也可以说根据最终的生成的一个结果,只在最后一个这个 token, 或者说在这个句子生成结束的时候,我们才给它一个 autoboturation, 就是 一个结果的一个奖励。 我们现在应该训练中用的比较多的还是这种,呃, autobots supervision 就是 结果维度的奖励。好的,我们再来看一眼在大约模型训练中,我们要建模的目标和我们这种 general 的 rl 会有什么样的区别。 其实我们要建模的目标跟 i 楼是比较相近的,就是我们还是要去最大化 rewind, 或者说应该叫 return, 它这边简化成 rewind 是 因为默认为这种 out of foot supervision 其实应该是整个轨迹的一个 return。 然后同时呢我们一般还会有一个类似政策项的这样的一个项,就是我们会先有一个这个 reference model, 就是 一个参考模型,然后我们会拿我们想要训练的这个模型呢, 和它去算一个这个 k l 散度来去刻画它和这个 reference model 输出之间的差异性,然后我们会想要控制这个差异不会特别大。 我们一般拿来做这个 reference model 的 模型呢,都是我们上一轮训练结束的一个模型, 比如说我们在训练 instructor gbt 的 时候,我们就会拿 sft 结束的这样的一个模型当做我们的 reference model, 或者说如果你有多个阶段的强化学习的训练,你也可以拿某一个阶段的训练的结果当做下一个阶段的这个 reference model。 总之就是我们会加上一个这种偏惩罚的这样的一个政策项, 然后同时还会有一个这个贝塔的参数来去控制惩罚项的一个权重。 ok, 然后下面这边画的这个图呢,其实就是大圆模型的两种训练方法,它们主要区别就在于这个 reward 是 从哪里来, 就比如说最常见的 reinforce learning from human feedback, 它就是我们先拿一些这个标注好的 preference data 信号数据去训练一个 reward model, 然后这个路由 model 就 可以根据语言模型的输入,就 prompt 和输出来给它做一个量化的打分。 然后我们需要训练这个语言模型,或者说我们这个 policy 呢,就是跟这个路由 model 去做交互,来根据它的这个监督 来去作为训练。至于 reinforce learning with verifiable reverse, 它就是有一个可验证的奖励。比如说在数学题中,我们就可以去对比语言模型输出的答案和标准答案, 然后在这种编码过程中,我们就可以拿编辑器的输出或者说单元测试的输出来去作为我们的一个语言模型。好的,那我下面这边还找了一个动图, 它就是来描述了上面提到的两种大语言模型强化学习训练算法的一个流程,就是去迭代的做以下这个四个步骤,我们先是采用一批输入 prompt, 下一步呢,我们再根据这个 prompt 做语言模型的采用,得到一系列的输出。 然后第三步呢,就是根据这个输入和输出去向这个路由 model 或者说 fire 去获得奖励的一个信号。 最后一步才是根据强化学习算法去做策略更新。然后下面这个部分呢,我们会来介绍一些这个具体的强化学习的算法。 我们会在下一个视频中先讲这种最简单的 lina policy gradient v, 在 这之后呢,我们会再介绍一些更主流更 modern 的 一些这个算法,就比如说云 force, 然后以及说我后面还没有写的这种 dpo ppo, 以及说这个 jrp 这样的一些算法。 然后最后这个部分是我最近学习中阅读的一些博课,对,大家也可以直接去这个这个博课上去看一看原文。好的,以上就是我们本期视频想要一起分享和学习的一些内容, ok, 大家下个视频见。


很好,就这样啊,就等他升级啊。坐等升级啊,昨天的仅仅杠杠的四百多啊,要到四百多,太爽了。升级了马上才一点点啊,三分半升一级, 升级了三分半升一级,也就是说我这里还可以升三级,三四十二升四级啊,升四级的样子啊。你这个已经够快了,你不能再快了,五十四亿啊,唯有征服才是奇迹。

哈喽,大家好,我是麻花,上期视频,我花某人真的走了狗屎运啊!沙漠遇到一条死龙,哎,取其龙骨,做出龙骨剑与龙骨弓,没想到这个沙漠地带还真的是值得探索呢。这一不小心又遇到了九层妖塔,独眼大怪又成了我的火把子,咱们采取的战术仍然是远程攻击 哦,嘿嘿,看到没,这家伙生气了,又自爆了!捡起触摸屏,先给自己加加经验,看看这满地的装备,好像每次都差不多呀!哇,这经验生的有点爽歪歪呀! 钻石块咱们捡起来,这里还有一颗心之容器,这只能提升我们血量的,之前我都没有注意,以后这玩意咱们可得多捡啊!我说怎么呼噜呼噜叫呢,仔细一看,原来这个独眼大怪并没有死啊,臭弟弟也是时候展现我的实力, 好像还真没有跟这个独眼大怪正面交分过,那今天就面对疾风吧,看看他的血量,居然还剩一半,我的天,这家伙是不是自带回血功能啊?来,拿出我的大宝剑,你这个大肚眼再看我试试,我现在果然是飘了,可以跟这个独眼大怪正面刚了, 看到没,聊聊几下咱们就把它拿下。小伙伴们,我现在的实力真是不可小觑啊,完事以后就是咱们的常规操作了,挖窗外容,拿经验, 我丢什么鬼?算了,该拿的宝贝咱们也拿了,关键是我又发现了一处好地方, 这个可能就是传说中的蚂蚁窝呀!听说打死这些乙黄以后就会掉落一些孔乙刺、甲壳,这些东西都可以制作装备的。我的天,前面这个左右摇摆的是不是就是他们呀?初来乍到,咱们先 小事火力,哎,差点忘记了咱们小事什么火力,拿出我的法杖召唤一下雷阿蒙啊, 你看看吧,根本就不用我出手,关键时刻我给他致命一击。臭弟弟,这哪是我的对手啊,来,将他的战利品先收集一下,这个蚂蚁窝好像并没有多大,这以后就在这里,我根本就不用出手啊,哎,整错人了你,我的天,这家伙 好嘛,这个以后还是很厉害的,虽然我召唤了雷阿蒙,但是打以后还是有点吃力啊。这时有粉丝建议我可以召唤一个合体生物。合体生物顾名思义就是召唤两种元素,比如火元素和水元素。来,咱们先把火元素召唤出来。 yeah! 好,火元素出来了,再召唤一个水元素,咱们 看看他们合体到底是个什么东东。我的天,合的这么快吗?直接出来一个绿色生物,他的名字叫萨凡,是一个等级二的生物。 一出来我也是迫不及待啊,那肯定是要看看他的战斗力,但是这玩意还有点小倔强啊,火元素都跟我过来了,他愣是没反应啊,这我就有点迷了,咱是不是得跟这个家伙 pk 一下我才管事呢? 好吧,这个生物我觉得有必要研究一下子,当然,有知道的小伙伴咱们要踊跃发言啊,那么本期视频就到这里了,不要忘记点赞以及关注哦,咱们下期不见不散!

哈喽,大家好,我是麻花,今天咱们玩这个传说中的巨难生存,上期视频,我来到了平顶山,碰巧遇到了这个奢华的宫殿,但是 没有想到的是,这么奢华的一个宫殿里面居然没有一点宝贝。没有宝贝也就算了,全是火元素满天飞,此地不宜久留啊,主要是没有逗留的必要啊。车 哇,在二 l 生存里怎么会有这么多地牢啊,我听说在这里只要你干不怕死,升级还是很快的,目前我的魔法值已经到达了巅峰,我知道咱们这个法杖召唤的生物会不会随着我的魔法值升高而增强呢? 这次我准备召唤一只新型生物,没错,那就是水怪。来吧,小伙伴,让我看看你的实力吧,这个地牢也是火元素非常多,我觉得用水怪 打他们效果应该不错吧。来,水怪兄弟,跟我速度下去,打开杀技。哎,你是得有多皮啊,让你参加战斗,你赶紧的呀。啊,不是,你这是什么造型啊,在这呆着干什么呀, 你这是什么操作啊,站在这里自残呢?这个谁能给我一个完美的解释,为什么水怪会卡在这里,噗噗,掉血啊,我太难了,召唤一个新生物,他居然嫌弃我。来吧,召唤一只雷阿蒙, 别看这这小耗子体格小,但是最初我可是最烦他的,我觉得他的攻击力可以,主要是他把这顶起来那一下真的恶心啊,哎,我相信我俩搭配肯定是干活不累。哇,这个宝箱,你是真的穷啊,这地牢除了刷刷经验真的就没别的了。我的天呐,坏事了,这个车什么鬼,感觉不像 普通的霍元素啊,我的妈呀,我有点蒙了,这伤害也太高了吧。走着,咱们继续探索,对面一只卡布拉,忘记说了,我的钻石剑目前是附魔了,一个风力三的属性,所以说打这个卡布拉就是两下的事啊。前面还有一个甩拐龙,咱们过去刚 呦蜘蛛的双管龙,不要慌,召唤雷压门,让你们见识一下雷压门的厉害, 看到了吧,小小的蜘蛛我根本不用出手啊,这只臭地铁更是害怕的爬在这上面。你们就说说这雷亚猛猛不猛吧, 挖掉刷怪龙,咱们的经验又到手了,对面来了一只小僵尸,看我雷阿蒙怎么盘你!目前我的魔法值不是很多,只能召唤一只雷阿蒙,但是我看这一只雷阿蒙也够小僵尸瘦的呀,实力真的强, 以后这雷压门就是我的得力助手。我通过这个地牢不断升级我的技能,况且目前我身上还有五十多级经验可以升级,我看一下能不能把攻击的等级再给提升一下。 ok, 二十五级的攻击等级还可以,貌似这个地牢也快被我拿下了,接下来我还要再寻找九层妖塔或者是这种地牢,将攻击等级给他升满。好了,小伙伴们,我本期视频就到这里了,不要忘记点赞以及关注哦,咱们下期不见不散!
