腾讯混元开源首个面向世界模型的强化学习后训练框架

36氪获悉,腾讯混元3D团队开源首个面向世界模型的强化学习后训练框架WorldCompass。据介绍,这是一个专为长时序、交互式世界模型设计的强化学习(RL)后训练框架。如果说世界模型是引擎,那么WorldCompass就是精准的“指南针”,通过引入强化学习机制,直接“引导”模型如何更准确地遵循用户指令探索世界,并保持长时序的视觉一致性。原文链接

赞(0) 打赏
未经允许不得转载:Donews采集站 » 腾讯混元开源首个面向世界模型的强化学习后训练框架

评论 抢沙发

觉得文章有用就打赏一下文章作者

非常感谢你的打赏,我们将继续提供更多优质内容,让我们一起创建更加美好的网络世界!

支付宝扫一扫

微信扫一扫