返回 AI 资讯
技术社区博客园首页

LLM | 论文速读:如何使用 RL 缓解 LLM 过长问题 - MoonOut

【摘要】我们探寻 RL、Behavior Reward Model 和 Agent 输出长度之间的张力:可否“反其道而行之”,探寻 Agent 输出过长的深层原因,以 BRM 的形式由 RL 加以惩罚,从而抑制 LLM 输出长度增长? 阅读全文

内容摘要

【摘要】我们探寻 RL、Behavior Reward Model 和 Agent 输出长度之间的张力:可否“反其道而行之”,探寻 Agent 输出过长的深层原因,以 BRM 的形式由 RL 加以惩罚,从而抑制 LLM 输出长度增长? 阅读全文

资讯来源

博客园

原文链接

打开原文
LLM | 论文速读:如何使用 RL 缓解 LLM 过长问题 - MoonOut · AI 资讯 · AIGOOD - AIGOOD