LLM推理优化工程师
智谱深算科技有限公司
岗位信息
###
岗位职责
1. 负责大模型(如Llama, Qwen等)的推理加速优化,通过vLLM, TensorRT-LLM等框架提升并发处理能力与响应速度。 2. 探索并实现模型量化(INT8/FP8/NF4)与蒸馏方案,在保证模型精度损失最小的情况下降低显存占用。 3. 针对具体业务场景优化KV Cache管理及Attention算子,解决长文本推理时的性能瓶颈。 ###
任职要求
1. 计算机相关专业硕士及以上学历,3年以上AI算法或工程经验,熟悉PyTorch/DeepSpeed等深度学习框架。 2. 深入理解Transformer架构及LLM推理机制,有实际的模型量化或算子优化经验者优先。 3. 精通C++或Python,熟悉CUDA编程或Triton,能够高效地进行性能分析与瓶颈定位。 ###
加分项
- 在顶会(NeurIPS, ICML, ICLR等)发表过相关论文,或有知名开源项目贡献者经验。