返回 AI 资讯
AI 资讯量子位

精准揪出RL训练数据Bug,Prompt直出小游戏,IQuest-Q1夯爆了!

星空下,一辆白橙色的反重力赛车如利刃出鞘,猛地切进弯道,丝滑拐弯,在赛道上拖拽出一道道冰蓝光带,溅起金黄色的摩擦星火,直至冲线。 这可不是好莱坞特技大片,而是我用 IQuest-Q1模型 搓出来的沉浸式反重力竞速游戏。 它既能 凭一句Prompt原地打造一款炫酷游戏 ,也能 把十万步三体方程解成克林姆特笔下流淌的金色丝线 ,甚至还能 从RL训练数据里揪出隐藏空格bug ,让模型重回训练正轨。 △ 数值求解三体问题运动方程实测(10万步以内) 从Benchmark的表现来看,IQuest-Q1也交出了一份相当能打的…

内容摘要

星空下,一辆白橙色的反重力赛车如利刃出鞘,猛地切进弯道,丝滑拐弯,在赛道上拖拽出一道道冰蓝光带,溅起金黄色的摩擦星火,直至冲线。 这可不是好莱坞特技大片,而是我用 IQuest-Q1模型 搓出来的沉浸式反重力竞速游戏。 它既能 凭一句Prompt原地打造一款炫酷游戏 ,也能 把十万步三体方程解成克林姆特笔下流淌的金色丝线 ,甚至还能 从RL训练数据里揪出隐藏空格bug ,让模型重回训练正轨。 △ 数值求解三体问题运动方程实测(10万步以内) 从Benchmark的表现来看,IQuest-Q1也交出了一份相当能打的成绩单。 它在仓库级代码生成NL2Repo、网络安全基准CyberGym、终端Terminal-Bench 2.1、代码长程任务DeepSWE v1.1、办公场景JobBench等复杂任务评测中均表现不俗。 这么看,在同参数量模型中,它的表现是相当可圈可点的。 那么IQuest-Q1究竟是一款怎样的模型?它具体能帮我们做些什么?它诞生的研究土壤是怎样的? 看完你就懂了~ 320B参数只激活15B:模型正在尝试自己“跑”完研发闭环 首先,让咱们来扒一扒IQuest-Q1的底层框架。(doge) IQuest-Q1采用了 decoder-only Transformer主干 ,配 稀疏MoE架构 ,总参数约 320B ,激活参数约 15B 。 这意味着,它虽然体量看起来像个 “沉睡的绿巨人” ,但稀疏激活一上线,便能立马化身 “精准点穴的叶问” ,每一分算力都点在关键的穴位上,一点都不带浪费。 更有意思的是,我们从IQuest-Q1官宣的少量文字中察觉到, 模型亲自参与了自身的研发迭代。 一旦它提出的研发方案被人类研究者们拍板通过,那么验证过的模型更新、训练资产和研究流程,便会直接流进下一轮迭代,被后续版本接着用。 而每一轮攒下来的数据流程、训练配置、评估方法和工具,也会像滚雪球一样越滚越大,直接转化为后续版本可复用的研发资产。 看着挺厉害,那么问题来了,它到干活的时候真的好使吗? 光说不练假把式,接下来,咱们直接来两道实测题,看看它到底能不能打。 从国庆宅家打怪,到揪出一个空格引发的RL训练故障 实测一:《国庆卧室保卫战》小游戏 第一题,我直接让IQuest-Q1给国庆不想出门人挤人、SAN值狂掉的我,搓个 《国庆卧室保卫战》小游戏 。 这个游戏妙就妙在,虽然我们明明早就决定好了不出门旅游,想在家养精蓄锐、回回血; 可一刷朋友圈,九宫格一个比一个精致,心里又忍不住冒出点遗憾和苦恼,更别提每天早上爬起来,还得纠结半天今天到底干点啥了… 我就想看看, 咱们能不能顺手把这个烦恼也外包出去 : 结果相当美妙。 我只丢给它一段200字左右的提示词,外加摸鱼三分钟,它就交给我一个能在竖屏手机上直接玩的HTML游戏。 更绝的是,它还给各位“小情绪怪”配好了独一无二又精准的 NPC设定 和 血条 。 游戏里,我可以尽情把枕头当武器,指哪打哪,专治各种坏情绪。 同时,要是咱们玩嗨了,被怪兽击中要回血,那也可以直接回床上躺平,血条蹭蹭往上涨。 游戏结束后,它还会从奶茶、炸鸡、看电影、逛超市、附近散步里随机掉落一个 “今日目标小彩蛋” ,让咱们在不知道干啥的时候直接抄作业。 而且战果还能一键保存,发朋友圈就一句话: 这个国庆,我的松弛感满级了 。 游戏玩完后,让咱们回到代码现场来测点烧脑的。 毕竟光会做游戏顶多算个气氛组,真本事还得看硬核活儿。 来,直接上强度——揪出那个让RL训练翻车的空格错误。 实测二:把RL训练中,那个导致故障的空格错误揪出来 这次就不是模拟题了,而是一个真实RL训练里常踩到的坑。 让我们来看一个官方Blog里的实测案例吧。 故事始于一条不太对劲的Reward曲线。 当时,一场RL训练中突然发现,Reward曲线没有按照预期爬升,像被什么看不见的东西卡住了一样,非常不对劲。 然后,研究人员们试着把这个问题交给IQuest-Q1,并让它基于Claude Code CLI框架分析训练日志、训练中的落盘轨迹,并从代码库中反向追查故障原因。 最终,问题被定位到RL框架接入Scaffold时的文本回传与轨迹拼接环节—— 推理服务在文本解码时额外插入了一个空格 。 这个空格看似微不足道,却足以让模型生成文本与回传历史错位,导致前缀匹配断裂、多轮生成中断、RL训练前几轮的读代码、跑命令、改代码全白跑了,只练了最后一轮回答。 好在IQuest-Q1及时发现并修复了这个Bug,才让训练得以正常进行。 △ 修复后的Reward曲线,实测源自官方Blog 从创意生成到工程排错,两场实测看下来,我能明显感觉到 IQuest-Q1不只是能答,更能稳稳交付经得起查验的成果。 而要理解IQuest-Q1为什么如此重视交付,咱们不妨扒一扒它的研发团队 至知创新研究院IQuest Research 。 把时间往前拨,我们就可以看到这个团队在短短时间内成果频出。 模型不一定追“高”,各种能力夯扎实 从今年7月底到8月,团队逐步把研究扎进模型训练的核心环节,并相继提出了 MuonH优化 、 UBio-MolFM 和 稀疏权重分解 等研究成果,为模型训练打下了坚实的基础。 再到本月16号,IQuest Research参与提出的 ModularRSI自进化框架 登上了Hugging Face日榜第二。 它不仅将Agent在Terminal-Bench 2.0和SWE-Bench Verified的准确率分别从47.57%、73.40%提升至 52.43% 、 76.45% ; 更能让Agent把习得的执行能力跨任务、跨模型直接复用,有效解决了自改进中信用分配与泛化的难题。 如今,IQuest-Q1的出现,似乎让一切顺理成章。 无论是实测中赛车能不能开、游戏能不能玩、训练中出现Bug能不能及时找到根因; 还是团队从堵住Agent搜索时的偷懒捷径,到让模型参与下一轮研发,IQuest Research团队追问的始终是同一件事: AI能不能把复杂任务做对、做完,并让每一次交付都成为下一次进化的起点。 别眨眼,新故事已经开始了。 你准备好了吗? 感兴趣的小伙伴们可以点进文末链接查看更多模型信息呀: 参考链接: [1]GitHub: https://github.com/IQuestLab/IQuest-Q1 [2]Hugging Face: https://huggingface.co/IQuestLab/IQuest-Q1 [3]Blog: https://iquestlab.github.io/ 一键三连「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 点亮星标 科技前沿进展每日见 版权所有,未经授权不得以任何形式转载及使用,违者必究。 AI大模型 IQuest-Q1 RL 文婷 扫码分享至朋友圈 相关阅读 谷歌用大模型重写超级助手,为推进度先裁员重组! 移动端率先使用 AI大模型 谷歌 套壳丑闻让斯坦福AI Lab主任怒了!抄袭团队2人甩锅1人失踪、前科经历被扒,网友:重新认识中国开源模型 清华刘知远也回应了 AI大模型 抄袭 斯坦福 10行代码让大模型数学提升20%,“野路子”研究谷歌也测上了 平衡生成文本的连贯性和多样性 AI大模型 大模型 数学 小冰李笛:真正的AI信仰者不该FOMO | MEET 2025 AI天生注定是为私域服务的 AI大模型 MEET2025 MEET2025智能未来大会 商业模式 小冰 李笛 U设计周大谈AI时代的设计,不懂点大模型都落伍了 设计师跳出焦虑,看清生产力变革的本质 AIGC AI大模型 设计 这家研究院太年轻,竟敢跟世界级选手“叫板” 不背靠大厂做大模型、年年能请来图灵奖得主 AI大模型 人工智能 智源 热门文章 PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍 出海Agent“小元AI”入驻腾讯WorkBuddy:找买家写开发信谈生意 别人忙着卷Code,Kimi抽身反打浏览器插件:网页操作一秒变Skill 亮出“中国最强AI芯片”还不够,平头哥又甩出一手开源 GPT-6之后,具身智能走向何方?诺因发布GLOW技术报告,给出机器人“一教就会”的答案 加入我们 寻求报道 商务合作 追踪人工智能新趋势,报道科技行业新突破

资讯来源

量子位

原文链接

打开原文