乐于分享
好东西不私藏

AI 芯片软件栈架构师

AI 芯片软件栈架构师

一、一家做全自研高性能 AI 芯片的科技公司,不是买 IP 做集成。北京、成都、杭州、西安、深圳都有研发团队。目前芯片已经落地,重点在补软件栈和生态,所以对软件栈架构师的需求比较明确。团队整体偏工程和技术,管理动作相对较少。 

 二、方向是 AI 基础设施软件栈架构师/专家,偏 IC 路线,不带大团队,但需要牵头技术项目,指导中高级工程师。Base 地可选北京、上海、成都、杭州、西安、深圳。

 三、主要在做的事情  负责软件栈整体架构规划:算子库、编译器、运行时、通信库、训练/推理框架等核心组件的技术选型和演进路线。  与芯片/硬件团队协作做软硬件协同设计,结合芯片的算力、显存带宽、互联拓扑,把硬件性能充分释放出来。  建立性能分析体系,用 Roofline 模型、计算访存比分析等手段,定位 Prefill/Decode 等关键路径的算力/带宽瓶颈,并推动 Kernel 级和系统级优化。  负责大模型训练与推理的性能优化,包括分布式并行策略(TP/PP/DP/EP)、显存管理、KV Cache、量化、投机采样、MoE 负载均衡等。  牵头解决高并发推理服务、长上下文、多模态等场景的技术难题,并推动优化方案产品化落地。  制定技术规范,带教中高级工程师。

 四、等一个同频的人,计算机、电子工程等相关专业,硕士及以上更常见;经验上偏资深,通常需要多年 AI 系统/高性能计算方向积累,最好有 3 年以上架构设计经验。  编程能力:精通 C++/Python,具备大型系统软件的设计与落地能力。  硬件理解:深入理解 GPU/NPU 体系结构,熟悉 CUDA/Triton/PTX,有 Kernel 级性能优化实战。  框架能力:深入理解至少一种主流框架内部机制,比如 PyTorch、vLLM、SGLang、TensorRT-LLM、Megatron-LM、DeepSpeed 等。  编译器/算子:熟悉 MLIR/LLVM/TVM/XLA 等编译器技术栈,或有算子开发、图优化、算子融合经验者优先。  分布式:熟悉 NCCL、RDMA、NVLink 等高性能通信,有千卡级以上集群训练/推理优化经验者优先。  性能分析:熟练使用 Nsight、Profiler 等工具,能从体系结构层面定位并解决瓶颈。  加分项:  参与过 AI 芯片软件栈从 0 到 1 建设,或做过国产 NPU 适配迁移。  熟悉 MoE 模型(如 Qwen3、DeepSeek 系列)的训练/推理特性与优化。  在 vLLM、PyTorch、Triton 等开源社区有实质贡献,或在 MLSys、OSDI、SOSP、ASPLOS 等顶会发表过相关论文。  熟悉多模态大模型 VLM 推理服务优化。

 五、回报与福利 15 薪,现金年包从大几十到百万级,具体看级别和面情况,覆盖资深工程师到专家/高级专家。偏技术序列。  福利方面比较直接:五险一金按实际基数缴纳,假期按国家标准执行。住房、通讯、交通补贴暂时没有,整体以现金回报为主,不靠福利堆总包。

 六、不太适合纯上层应用开发或只会调 API 的工程师。更适合做 HPC、编译器、推理框架、Kernel 优化、分布式训练/推理系统的。尤其是之前在 GPU/NPU 原厂、AI 芯片公司、大模型 Infra 团队待过的朋友。

 敲门敲门哈。