×
加载中...
前字节/腾讯专家孙鹏加入星尘智能,负责机器人 RL 后训练
AI科技评论 2026-09-02 10:48
AI科技评论独家获悉,近日,强化学习专家孙鹏正式加入星尘智能,在业内被视为后者正提前布局机器人强化学习后训练的重要信号。

孙鹏博士毕业于清华自动化系,师从信息处理研究所周杰教授,后在康奈尔大学和罗格斯大学完成博后项目,与担任其博士后Advisor的张潼教授渊源颇深。2016 年,孙鹏加入了彼时张潼领衔的腾讯 AI Lab,任高级研究员;后来到张正友领衔的腾讯 Robotic X 实验室,任智能体学习中心的团队负责人。

2020年,孙鹏加入字节跳动,在游戏AI部门负责多智能体、分布式大规模强化学习技术,主导开发强化学习基础设施ByteRL,支撑字节多款自研游戏AI训练和定制;还带队获得IEEE CoG 2023策略卡牌AI竞赛冠军,其《炉石传说》AI曾在测试中以全胜战绩击败国服排名前十的游戏主播,验证了大规模强化学习在复杂决策任务中的产业化能力。
在字节AI Lab / ByteResearch期间,孙鹏作为项目负责人参与研究并发布强化微调方法ReFT,以及数学推理智能体DeltaProver,其中ReFT以超越传统的数学微调能力,甚至被认为影响到了OpenAI o1式的推理范式;其在Seed团队参与模型RLHF与预训练工作,将强化学习进一步拓展至大模型对齐、推理增强和Agent方向。

机器人RL后训练时代来临

过去两年,大模型帮助机器人获得了语言理解、任务规划和泛化能力,VLA模型解决的是机器人“知道该做什么”的问题。
但机器人进入真实环境后,还需要不断面对新的工具、新的场景和新的失败案例。如何根据真实反馈不断调整策略、优化动作,持续学习和进化,正成为Physical AI下一阶段的核心挑战。
强化学习正重新成为机器人智能持续演进的重要技术,也让同时具备机器人强化学习、大规模RL系统工程、RLHF和推理强化训练经验的人才变得愈发稀缺。
星尘智能在八月结束的世界机器人大会,刚刚展示最新发布的世界首个隐式世界动作模型Lumo-2,强调模型“先预测未来,再生成动作”,模型前端配备Agent Philia,具备长期记忆、多机器人协同调度、与人自然交互等能力,而模型后端的强化学习,将决定机器人如何在真实世界中不断成长。
孙鹏的加入将进一步加强星尘智能在机器人强化学习及后训练方面的研发能力。未来,公司计划结合世界模型、具身OS与绳驱机器人本体,探索机器人在真实环境中的持续学习和策略优化。

(转载自:AI科技评论)

扫码下载app 最新资讯实时掌握