核心进展

据量子位9月2日报道,星尘智能当日宣布,前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士已正式加入公司,重点负责机器人强化学习方向的技术研发与应用探索。媒体报道引述公司提供的信息称,该人事变动已于当日生效,孙鹏将参与具身模型、机器人强化学习及后训练体系建设,探索大模型时代验证的强化学习方法与真实机器人执行、数据闭环的结合。

背景与影响

孙鹏博士毕业于清华大学,先后在康奈尔大学和罗格斯大学从事博士后研究,长期聚焦强化学习、智能体及多智能体强化学习。腾讯时期曾任智能体中心负责人,开展深度强化学习与机器人控制及《星际争霸》智能体TStarBots等研究;字节跳动时期主导核心强化学习基础设施ByteRL,支撑多款游戏AI训练并获IEEE CoG 2023策略卡牌AI竞赛冠军,随后参与大模型强化微调方法ReFT与数学推理智能体DeltaProver等工作,并在Seed团队参与RLHF与预训练。星尘智能坚持Design for AI,构建“AI模型+具身OS+绳驱本体”体系,基座模型Lumo系列与Agent Philia分别覆盖环境理解与长期任务协同,强化学习被视为模型走向规模化真实部署的关键环节。

限制与下一步

上述信息来自量子位9月2日14:06发布的转载报道,注明“本文由星尘智能提供”。截至9月2日检索时,星尘智能官网新闻动态最新仍为7月25日,尚未同步该人事信息,具体职责分工与团队规模以公司后续官方披露为准。后续可关注公司在强化学习后训练与真实机器人执行结合方面的技术披露与验证进展。