算法工程师 - LLM后训练
- KAON
- Beijing, China
- CNY 600,000 – CNY 1,200,000
BeijingFull-timeR&D - Algorithm
Responsibilities
参与公司AI算法相关工作,专注于提升大语言模型(LLM)的生成质量,推动技术创新和产品落地,具体职责包括但不限于:
- 监督微调:深入研究和实施大语言模型(LLM)的SFT、RFT等技术方案,优化AI的情感表达能力和剧情设计能力,突破长期记忆、行为一致性等技术难点
- 奖励模型:基于海量用户交互日志和反馈数据,深入挖掘真实用户偏好信号,构建高质量的偏好数据集;设计并实现包括生成式奖励模型(GRM)、过程奖励模型(PRM)等在内的多维度奖励函数
- 强化学习:深入理解PPO、DPO、GRPO等常用LLM强化学习方法,结合具体业务目标(如上下文一致性、逻辑正确性、OOC等),设计定制化的奖励组合与训练策略
- Agent:面向复杂、多步骤的业务场景,设计并实现基于大语言模型的Agent架构;集成工具调用(Tool Use)、记忆机制(Memory)、反思(Reflection)、多智能体协作等范式实现复杂任务的能力跃迁
Qualifications
- 优秀的代码能力、数据结构和基础算法功底,熟练C/C++或Python,ACM/ICPC、NOI/IOI、Top Coder、Kaggle等比赛获奖者优先;
- 熟悉NLP、CV相关的算法和技术,熟悉大模型训练、RL算法者优先;
- 在虚拟角色生成、角色扮演、情感陪伴等方向有项目经验或论文成果者优先;
- 能系统性拆解角色类模型在生成一致性、长期记忆等场景的挑战,提出创新解决方案;
- 具备较强自驱力,能与产品、算法团队紧密协作,推动技术从研究到落地的全链路闭环。
Apply
Skills
- Python
- C++
- PyTorch
- LLM Fine-tuning
- Reinforcement Learning
- NLP
- Data Analysis






