查看: 244| 回复: 0
跳转到指定楼层
上一主题 下一主题
收起左侧

[我司要招人] infra 国内招人 base北京上海深圳

全局:

2026(10-12月)-CS硕士+1-3年 | 猎头|中国大陆 码农类General全职@
除以下岗位,对其他公司infra相关的岗位有兴趣私我
快手可灵ai专硕,大模型推理优化工程师base北京/上海:

要求:



快手可灵ai专硕,大模型训练框架研发工程师base北京/上海:. 1point 3 acres

要求:

快手可灵ai专硕,模型优化算法工程师(base在北京):. .и

要求:

资深 AI Infra 工程师 —德塔源创— 大模型训练与推理性能优化 职位描述
  • 关于这个岗位你将负责大模型(LLM / VLM / 多模态 [/ 具身智能 VLA 模型])从训练到推理的全链路性能、扩展性与稳定性。在数百至数千卡集群上设计并优化分布式训练策略、压榨硬件算力提升Model Flops Utilization (MFU),同时研发高性能推理引擎、把延迟打下来、把吞吐拉上去。你会在研究与系统的交界处工作,把算法创新快速、稳定地工程化落地。2. 岗位职责2.1 训练1) 负责千亿级参数大模型(LLM / VLM / 多模态)的分布式训练架构设计与性能调优,在大规模 GPU 集群上扩展训练吞吐。2) 设计并落地各类并行策略——数据 / 张量 / 流水线 / 序列 / 专家并行(3D / 混合并行),解决多机多卡训练中的通信瓶颈。3) 对计算、通信、存储、I/O、显存、调度等各层级做全栈性能优化,持续刷新训练效率与 MFU 基准。4) 基于 Megatron-LM / DeepSpeed / PyTorch-FSDP 等框架优化预训练(Pre-training)、指令微调(SFT)与强化学习(RLHF)全流程,并推动框架持续演进以支持多模态、复杂结构、超大参数等模型升级诉求。5) 保障大规模训练稳定性:快速 / 异步 checkpoint、容错、异常检测与自动恢复,支撑长周期多机多卡任务。6) 将前沿论文与技术(长序列、低精度 FP8/FP4、通算掩盖、高效流水调度、算子融合等)高效转化为工业级工程实践。2.2 推理1) 研发并优化高性能模型推理引擎,降低延迟、提升吞吐,打造极致低延迟、高吞吐的线上服务架构。2) 深度应用 vLLM / TensorRT-LLM / SGLang / Triton 等推理加速框架,并针对业务场景做内核级(kernel-level)优化(如 FlashAttention、PagedAttention)。3) 优化计算图编译、动态 Batching(continuous batching)、KV Cache 管理等推理关键路径。4) 探索并落地量化(PTQ / QAT / FP8 / INT8)、剪枝、知识蒸馏等模型压缩与部署技术。2.3 技术演进与协作1) 持续跟进业界最新 Infra 技术(高效通信库、FP8/INT8 方案、FlashAttention 演进、RL 训练框架等),驱动技术预研并转化为生产力。2) 与算法、模型、研究团队紧密协作,做原型验证、性能评估与生产落地,推动模型效果与训练 / 推理效率的双重突破。 职位要求
  • 任职要求
  • 大规模分布式系统 / GPU 训练或推理基础设施 / 高性能计算 / ML 系统的研发经验。【负责过千卡级别大模型训练及部署加分】
  • 精通 Python 和 C++,具备扎实的数据结构、算法与并发编程基础,熟练掌握 PyTorch(及 TensorFlow / JAX 之一者更佳)。【熟悉CUDA/Triton变成有自定义高兴能算子开发经验加分】
  • 熟悉 Transformer 架构的底层细节与主流大模型结构(Qwen / Llama / GPT / DeepSeek 等)。【熟悉强化学习算法及其并行大规模训练框架加分】
  • 精通至少一种主流分布式训练框架及其内部机制——Megatron-LM / DeepSpeed / FSDP——以及并行策略(DP / TP / PP / EP / SP),深入理解训练栈内部:PyTorch + CUDA + NCCL;熟悉 GPU 架构、显存层次与分布式计算理论。【熟悉编译器/运行时经验XLA / OpenXLA、torch.compile、MLIR、TensorRT-LLM加分。】
  • 具备训练或推理性能优化实战经验:显存、通信、吞吐、延迟(二选一精通、了解另一侧)。
  • 熟练掌握性能分析工具(nsys / Nsight / torch profiler / pdb / gdb 等)。
  • 在相关开源项目(HuggingFace / vLLM / DeepSpeed / SGLang 等)有贡献,或在顶级会议(OSDI / SOSP / NSDI / MLSys / NeurIPS / ICML / ICLR / ACL)发表过论文。

本帖子中包含更多资源

您需要 登录 才可以下载或查看附件。没有帐号?注册账号

x

上一篇:🚀 Harvey AI 内推|飞速增长 AI 公司|48h 内回复
下一篇:JPMC 摩根大通 组里招Java lead engineer
您需要登录后才可以回帖 登录 | 注册账号
⚠️: 通过大量刷回复等方式使帖子靠前的内推帖,将会被自动关闭下沉

⚠️ 每个人只可以有一个active的内推帖子,其他内推帖会被删除

本版积分规则

>
快速回复 返回顶部 返回列表