大模型推理优化工程师
极光智算科技有限公司
岗位信息
###
岗位职责
1. 负责LLM(如Llama-3, Qwen等)在生产环境的部署与性能调优,优化KV Cache管理及Attention计算效率。 2. 研究并落地模型量化方案(如FP8, INT8, AWQ),在保证模型精度损失最小的情况下提升推理速度。 3. 针对特定硬件(NVIDIA H800/A100)优化CUDA算子,减少内存带宽瓶颈,提升端到端推理吞吐量。 ###
任职要求
1. 计算机或相关专业硕士及以上学历,3年以上AI工程经验,熟悉PyTorch或DeepSpeed框架。 2. 深入理解Transformer架构,熟练使用vLLM, TensorRT-LLM或Triton Inference Server等主流推理框架。 3. 具备扎实的C++/Python功底,有CUDA编程经验或高性能计算(HPC)优化经验者优先。 4. 对大模型量化、蒸馏或投机采样(Speculative Decoding)有实际项目落地经验。