技术社区博客园首页
LLM | 论文速读:如何使用 RL 缓解 LLM 过长问题 - MoonOut
【摘要】我们探寻 RL、Behavior Reward Model 和 Agent 输出长度之间的张力:可否“反其道而行之”,探寻 Agent 输出过长的深层原因,以 BRM 的形式由 RL 加以惩罚,从而抑制 LLM 输出长度增长? 阅读全文
内容摘要
【摘要】我们探寻 RL、Behavior Reward Model 和 Agent 输出长度之间的张力:可否“反其道而行之”,探寻 Agent 输出过长的深层原因,以 BRM 的形式由 RL 加以惩罚,从而抑制 LLM 输出长度增长? 阅读全文
资讯来源
博客园