返回 AI 资讯
技术社区InfoQ 中文

单次RL后训练烧掉260万美元、每步37亿Token,小米披露MiMo-V2.6“规模化强化学习”路线

点击查看原文

内容摘要

点击查看原文>

资讯来源

InfoQ 中文

原文链接

打开原文
单次RL后训练烧掉260万美元、每步37亿Token,小米披露MiMo-V2.6“规模化强化学习”路线 · AI 资讯 · AIGOOD - AIGOOD