加入我们

社会招聘

AI系统方案专家(J14205)

  • 招聘类别:社会招聘
  • 工作性质:全职
  • 薪资范围:面议
  • 招聘人数:若干
  • 工作地点:北京市,陕西省-西安市
  • 发布时间:2026-08-12

工作职责

1.基于自研高性能计算服务平台,设计并开发交付面向AI训练与推理的完整系统整体解决方案,包括AI加速卡配套驱动及上层运行时环境(Runtime);
2.定制开发适配主流AI框架的底层插件与图编译器后端接口,实现芯片指令集的高效映射,并输出标准化的AI方案部署手册与性能调优指南;
3.协同硬件工程师进行AI功耗验证与热管理策略实施,支持开发基于工作负载感知的动态调频调压(DVFS)固件模块,确保系统在长时间大模型训练下的稳定性;
4.构建面向AI开发者的专属SDK与调试工具链(包括Profiling工具、Memory Checker及仿真器接口),赋能内部算法团队及外部客户进行便捷的模型移植与性能分析;
5.跟踪AI硬件加速前沿技术(如稀疏化计算、混合精度训练、CXL内存池化),持续优化方案架构,并与OS内核、编译器、算法团队建立高效的Bug追踪闭环,推动产品快速迭代;
6.负责AI板卡在服务器上的全流程适配与验证,包括驱动部署、固件协同、健康管理(温度/功耗/故障监控)及带外管理(BMC/IPMI)方案设计,形成标准化的板卡接入与验收规范;
7.主导异构计算平台的系统架构与软硬件协同设计,统筹服务器主板、AI板卡、高速互联(PCIe/Switch/CXL)、存储与网络等子系统的集成方案,确保多卡扩展场景下的带宽均衡、延迟可控与系统稳定性;
8.打造面向最终用户的整体交付方案,输出包括系统部署手册、调优指南、基准性能测试报告、运维手册在内的完整文档体系,支撑产品从POC到规模部署的平滑落地。

任职资格

1.计算机相关专业本科及以上学历,8年以上AI服务器相关研发经验;
2.具备AI服务器或异构计算平台的系统方案设计经验,熟悉GPU/NPU/ASIC等AI加速卡在服务器中的集成要点(PCIe拓扑、供电散热、管理接口);
3.熟悉多卡互联技术(如NVLink、CXL)及其对AI训练/推理性能的影响,能设计合理的拓扑方案;
4.熟悉Linux平台下AI板卡的驱动安装、版本管理与故障排查流程,有GPU/NPU板卡批量部署与运维经验;
5.了解主流的AI训练/推理框架部署方式,能够结合底层硬件特点给出框架层的配置优化建议;
6.有基于RISC-V服务器平台的方案开发测试经验者优先;
7.具备优秀的英文技术文档读写能力,抗压能力强,具备良好的跨团队沟通与协作意识。

AI系统方案专家(J14205)

  • 招聘类别:社会招聘
  • 工作性质:全职
  • 工作地点:北京市,陕西省-西安市
  • 招聘人数:若干
  • 薪资范围:面议
  • 发布时间:2026-08-12

工作职责

1.基于自研高性能计算服务平台,设计并开发交付面向AI训练与推理的完整系统整体解决方案,包括AI加速卡配套驱动及上层运行时环境(Runtime);
2.定制开发适配主流AI框架的底层插件与图编译器后端接口,实现芯片指令集的高效映射,并输出标准化的AI方案部署手册与性能调优指南;
3.协同硬件工程师进行AI功耗验证与热管理策略实施,支持开发基于工作负载感知的动态调频调压(DVFS)固件模块,确保系统在长时间大模型训练下的稳定性;
4.构建面向AI开发者的专属SDK与调试工具链(包括Profiling工具、Memory Checker及仿真器接口),赋能内部算法团队及外部客户进行便捷的模型移植与性能分析;
5.跟踪AI硬件加速前沿技术(如稀疏化计算、混合精度训练、CXL内存池化),持续优化方案架构,并与OS内核、编译器、算法团队建立高效的Bug追踪闭环,推动产品快速迭代;
6.负责AI板卡在服务器上的全流程适配与验证,包括驱动部署、固件协同、健康管理(温度/功耗/故障监控)及带外管理(BMC/IPMI)方案设计,形成标准化的板卡接入与验收规范;
7.主导异构计算平台的系统架构与软硬件协同设计,统筹服务器主板、AI板卡、高速互联(PCIe/Switch/CXL)、存储与网络等子系统的集成方案,确保多卡扩展场景下的带宽均衡、延迟可控与系统稳定性;
8.打造面向最终用户的整体交付方案,输出包括系统部署手册、调优指南、基准性能测试报告、运维手册在内的完整文档体系,支撑产品从POC到规模部署的平滑落地。

任职资格

1.计算机相关专业本科及以上学历,8年以上AI服务器相关研发经验;
2.具备AI服务器或异构计算平台的系统方案设计经验,熟悉GPU/NPU/ASIC等AI加速卡在服务器中的集成要点(PCIe拓扑、供电散热、管理接口);
3.熟悉多卡互联技术(如NVLink、CXL)及其对AI训练/推理性能的影响,能设计合理的拓扑方案;
4.熟悉Linux平台下AI板卡的驱动安装、版本管理与故障排查流程,有GPU/NPU板卡批量部署与运维经验;
5.了解主流的AI训练/推理框架部署方式,能够结合底层硬件特点给出框架层的配置优化建议;
6.有基于RISC-V服务器平台的方案开发测试经验者优先;
7.具备优秀的英文技术文档读写能力,抗压能力强,具备良好的跨团队沟通与协作意识。