JobConnect

Long-Horizon Agent & Agent Reinforcement Learning Researcher

  • NIO
  • Shanghai, Beijing, China
  • CNY 500,000 – CNY 800,000

职位描述

本课题主要研究面向座舱多用户多轮复杂交互场景下,以及上百个不同工具的情况下,如何基于结合环境模拟器、用户模拟器的强化学习技术,构建可靠稳定的长程复杂任务执行能力,使座舱交互Agent可以适应不同用户、不同任务场景、不同环境和上下文,实现座舱内高端到端满足率的灵活自如的座舱任务完成体验。 具体工作包括但不局限于:在冷启动阶段构建仿真座舱交互环境、用户模拟器,搭建强化学习训练pipeline,提升agent任务完成的效果和效率,优化其输出话术风格与预设的智能体人设对齐;构建agent在线学习环境,基于真实用户交互轨迹和反馈,持续优化端到端体验,实现智能体的持续自学习。

职位要求

-博士及以上学历。 -精通Agent、强化学习技术和原理,熟悉大模型推理优化。 -加分项,在国内外顶尖实验室或者模型团队经历。

投递

Skills

  • Reinforcement Learning
  • Large Language Models
  • Agent development
  • Simulation Environments
  • Python
  • Model Optimization
  • Research

Related jobs

NIOApply for this job