乐于分享
好东西不私藏

紧急热招岗位 | AI算力芯片:GPU架构、互联与CUDA算子

紧急热招岗位 | AI算力芯片:GPU架构、互联与CUDA算子

硬科技招聘里,信息不对称是常态:候选人看不透公司的真实业务、订单能力和长期价值,容易被包装出来的机会吸引;企业也常常被漂亮简历迷惑,找不到真正能干活的人。

我们想做的,是把这中间的信息差补上。把职位背后的关键信息讲清楚,把行业里真正靠谱的机会挑出来,帮候选人减少试错,帮企业提升匹配效率。

岗位介绍
 Job Description

这一期我们聚焦AI算力芯片:GPU架构、互联与CUDA算子方向,带来 10 个硬科技中高端岗位,覆盖AI芯片技术资深专家、AI处理器核设计(GPGPU/NPU架构专家)、研发专家(大模型推理引擎调优方向)、GPU芯片互联架构资深专家等关键岗位。

每一个都经过我们筛选,值得候选人花时间细看。

所有岗位都是真实的保密委托需求,来自经过我们筛选的合作企业。简历投递和职业咨询不收费,欢迎联系咨询。

芯片与光电子:架构设计与光器件系统
AI算力芯片:GPU架构、互联与CUDA算子
-AI芯片技术资深专家-

城市:深圳/上海/西安

薪资:100-300W

职责:主导AI芯片架构设计与规划,制定技术方案确保芯片在性能、面积、功耗上的优势,协同算法、软件、硬件团队实现算法到芯片架构的高效映射与深度优化。

学历&工作年限:本科10年以上

要求:有大型互联网或大模型公司工作经验,熟悉昇腾/NVIDIA GPU使用与调优,掌握大模型训练与精调技术,具备AI芯片全流程架构设计能力。

-AI处理器核设计(GPGPU/NPU架构专家)-

城市:面议

薪资:100-300W

职责:负责AI芯片中GPGPU/NPU处理器核设计与架构规划,带领团队开发处理器核方案及代码,负责处理器核的PPA分析与优化。

学历&工作年限:本科8年以上

要求:8年以上处理器设计集成经验,有芯片流片经验,熟悉RISC-V/ARM架构与SIMT/Vector/SIMD/DSP等计算架构,有AI芯片设计经验。

研发专家(大模型推理引擎调优方向)-

城市:北京

薪资:60-120W

职责:负责大模型推理引擎架构设计与核心模块研发,开展编译、通信与低比特计算优化,设计PD分离与KV Cache管理等多维度并行推理方案,提升系统吞吐与稳定性。

学历&工作年限:本科8年以上

要求:8年以上经验,精通C/C++与Python,理解Transformer架构,掌握vLLM/TensorRT-LLM等框架,有异构或分布式推理优化经验。

GPU芯片互联架构资深专家-

城市:北京/上海/深圳/西安

薪资:100-300W

职责:规划GPU互联总线协议、智能网卡、端侧互联IP及交换机芯片规格,主导GPU组网架构设计,负责RDMA/UEC/NVLink协议研究与拥塞流控算法创新。

学历&工作年限:硕士10年以上

要求:10年以上ASIC开发经验,有2个以上大规模芯片(GPU/网卡/交换)架构设计成功经验,熟悉GPU/网卡架构及RoCEv2/IB/NVLink等传输协议。

AI算法资深专家(大模型后训练)-

城市:上海/西安/深圳/长沙

薪资:100-300W

职责:负责大模型后训练与精调,开展RLHF强化学习、模型蒸馏、压缩与量化技术研究,主导领域数据治理与语料处理流程建设,推动后训练技术在通信行业场景的落地与性能优化。

学历&工作年限:硕士10年以上

要求:扎实的深度学习理论基础,精通RLHF强化学习与模型微调技术,熟悉TensorFlow/PyTorch框架,有大模型后训练或预训练项目交付经验。

研发专家(大模型推理引擎算子开发方向)-

城市:北京

薪资:60-120W

职责:主导大模型推理性能优化,负责vLLM/TensorRT-LLM内核优化与INT4/FP8量化,用CUDA/Triton开发Attention/GEMM算子。

学历&工作年限:本科8年以上

要求:8年以上AI或高性能计算经验,精通C++/Python,理解Transformer架构,具备vLLM/TensorRT-LLM调优经验,熟悉CUDA算子开发。

GPU/显示虚拟化研发专家-

城市:成都/南京

薪资:70-130W

职责:负责车载座舱GPU与显示虚拟化技术开发、性能优化及架构演进,设计舱驾融合场景下GPU资源隔离与共享方案,解决Virtio-GPU等显示虚拟化技术问题。

学历&工作年限:本科5年以上

要求:5年以上GPU驱动/图形栈经验,精通C/C++/Rust,熟悉OpenGL/Vulkan/Virtio-GPU技术栈,有GPU虚拟化性能优化落地经验。

研发专家(大模型推理引擎工程方向)-

城市:北京

薪资:60-120W

职责:研发优化大模型推理引擎与PD分离调度系统,支持自研AI芯片推理引擎优化,利用NVLink/RDMA/GPU Direct提升数据传输性能。

学历&工作年限:本科8年以上

要求:8年以上开发经验,掌握C/C++/Python,熟悉TensorRT-LLM/vLLM,具备CUDA算子优化与分布式推理经验,了解NVLink。

资深研发专家(AI基础软件架构师)-

城市:上海/北京/成都

薪资:80-200W

职责:主导AI基础软件架构研发与演进,跟踪vLLM/VeRL等训推框架发展,利用CUDA/Triton/Tile-lang进行算子深度定制与编译优化。

学历&工作年限:本科8年以上

要求:8年以上相关经验,精通训推框架/算子编译/集合通信/模型适配至少一个方向,熟悉NPU/GPU微架构及CUDA/Triton编程模型。

AI芯片合作规划资深专家-

城市:南京/上海

薪资:80-150W

职责:负责智算产品外购AI芯片的合作对接,建立外购AI芯片指标体系,负责选型与模型测试,制定验证计划与测试用例,完成覆盖率分析和测试结果分析。

学历&工作年限:硕士10年以上

要求:具备计算机体系结构知识,熟悉CPU/GPU/AI加速器硬件架构,掌握主流大模型技术,具备验证平台搭建能力,能完成模型系统级验证。

关于我们:

我们是专注科技领域的中高端猎头团队,本期岗位均来自合作企业的保密委托,企业信息在初步匹配确认后才会完整披露,以下为合作公司介绍。

如何投递:

1.邮件投递:

邮件地址:zhuohu@xwthr.com

邮件主题请注明:主题【投递】技术方向 - 目标岗位 - 工作年限

如【投递】芯片后端设计 - Senior 工程师 - 7年,我们将在 2 个工作日内回复

2.直接添加顾问微信或致电咨询,备注「岗位意向」,我们来帮您判断是否匹配、值不值得聊

联系人:彭老师
电话:18870123306

3.卓乎高猎小程序:

您可以点击“卓乎高猎”小程序,点击对应的岗位,在页面的“投递此岗位”上传您的简历,也可点击“职业咨询”与我们进行沟通。

隐私与保障承诺:

简历投递、岗位匹配、职业咨询全程免费,我们不向候选人收取任何费用;您的简历与个人信息仅用于本次匹配,未经同意不会提供给任何第三方,沟通严格保密。

所有岗位均来自真实企业委托,匹配确认后完整披露企业信息;企业要求保密系客户需求,非岗位虚假。如有人以我们名义收费,欢迎您立即告知,我们将进行核实。