Agentic RL 算法实习生
分享这个机会转给正在找工作的朋友
职位说明
工作内容: 1. RL训练环境搭建:负责构建易用、稳定且支持高并发的工具调用环境,搭建和优化 Agent 框架。 2. 推理能力提升: 针对 DeepResearch、CodeAgent 等复杂推理场景,设计并实现高效的能力增强方案。 3. 数据合成与优化:围绕业务需求构建、筛选和优化 Agent 行为数据与知识增强语料,为对齐训练、RL 训练和持续预训练提供高质量数据支撑。 任职要求: 1. 计算机相关专业;在CCF-A类会议发表过相关论文者优先考虑; 2. 熟悉主流 Agent 框架(如 Claude Code、LangGraph、AgentScope、Qwen-Agent 等),具备实际开发或使用经验。 3. 熟练掌握主流 Agentic RL 训练框架(如 VeRL、OpenRLHF),具备后训练(post-training)和数据处理相关项目经验者优先。 4. 理解并掌握并行训练框架,有多机多卡训练经验者优先。
该职位来自企业官方集团招聘门户。当前归入品牌招聘入口展示,具体用人法律主体、签约主体和劳动关系请以投递页及录用材料为准。