9月2日消息,深圳绳驱AI机器人公司星尘智能宣布,前字节跳动强化学习专家、前腾讯Robotics X智能体中⼼负责⼈孙鹏博⼠正式加入星尘智能,将重点负责机器人强化学习方向的技术研发与应用探索。
据了解,孙鹏长期深耕强化学习(RL)、智能体(Agent)及多智能体强化学习(MARL),拥有横跨机器人强化学习以及大规模分布式RL系统与大模型强化学习的研究与产业实践经历。他的加入将进一步强化星尘智能在机器人强化学习方向的布局,并与AI模型、具身OS和绳驱机器人本体形成协同,推动机器人在真实世界中持续学习、不断进化。

孙鹏 来源:星尘智能
公开资料显示,孙鹏毕业于清华大学,先后在康奈尔大学和罗格斯大学从事博士后研究。2016年,孙鹏加入了彼时由张潼领衔的腾讯AI Lab,任高级研究员;后来到张正友领衔的腾讯Robotic X实验室,任智能体学习中心的团队负责人。
2020年,孙鹏加入字节跳动,在游戏AI部门负责多智能体、分布式大规模强化学习技术,主导开发强化学习基础设施ByteRL,支撑字节多款自研游戏AI训练和定制;还带队获得IEEE CoG 2023策略卡牌AI竞赛冠军,其《炉石传说》AI曾在测试中以全胜战绩击败国服排名前十的游戏主播,验证了大规模强化学习在复杂决策任务中的产业化能力。
随着大语言模型兴起,孙鹏进一步将强化学习积累拓展至LLM后训练。在字节AI Lab/ByteResearch期间,他作为项目负责人参与研究并发布强化微调方法ReFT及数学推理智能体DeltaProver;在Seed团队深度参与模型RLHF与预训练,在模型对齐、推理增强及Agent方向积累了深厚的前沿探索经验。
特别声明:以上文章内容仅代表作者观点,不代表本站观点或立场。如有关于作品内容、版权或其它问题请于作品发表后与我们联系。
CYQY-生活与科技