当前位置：小健博客 > 未分类 > 正文

解密prompt系列50. RL用于优化Agent行为路径的一些思路

2025-04-20 分类：未分类阅读(6) 评论(0)

而Deep Research的效果类似O1的长思考是非常长的行为链，OpenAI也直接表明Deep Research是使用和O1相同的RL训练得到的。但这里比O1更难的就是数据集的设计，训练过程动态行为数据的引入和RL目标的选择。

未经允许不得转载：小健博客 » 解密prompt系列50. RL用于优化Agent行为路径的一些思路

相关推荐

大前端WP主题更专业更方便

联系我们联系我们

QQ咨询
QQ咨询
回顶
回顶部