乐于分享
好东西不私藏

华为AI infra大模型面试,我跪了!!!

华为AI infra大模型面试,我跪了!!!

点击下方卡片,关注“AIGC小白入门”公众号

AI/CV重磅干货,第一时间送达

👇 2026年面试交流群成立

华为AI infra大模型面试,我跪了!!!

你们能想象吗?

就是那种,面试官坐在对面,轻飘飘问出一个问题,然后我脑子里的知识库瞬间“404 Not Found”的感觉。

没错,刚结束的华为AI infra大模型岗面试,我就是这个状态。赶紧写篇文章复盘一下。趁着记忆还热乎,把那些让我当场“裂开”的问题和我的真实反应记录下来。不是为了吐槽,是真的想帮大家感受一下,这种硬核岗位的面试,到底长什么样。

面试总共两面,连着面的,没给我太多喘息机会。

说实话,现在回想起来,手心还有点冒汗。

一面:技术硬核,招招致命

一面面试官一看就是技术出身,问题非常直接,基本没废话。

“聊聊你微调Qwen的时候,踩过什么坑?”

这个问题我事先准备过,所以还算稳。我说了数据集质量的问题——刚开始用开源数据直接训练,损失函数下降得很漂亮,但生成的答案完全没法看。

后来发现是数据里混了大量噪声,模型学到的是“如何说废话”,而不是“如何回答问题”。

面试官点了点头,紧接着就问:

“训练参数怎么设的?每个参数是干嘛的?”

这个问题看着基础,但很见功力。你不能只说学习率设了多少,得说清楚为什么这么设。

我当时大概这么回的:

学习率选的 2e-4,用的余弦退火调度。这个值不是拍脑袋定的,是我先用 1e-5 到 1e-3 跑了个小范围搜索,发现 2e-4 附近收敛最稳。这个值要是太大,微调时预训练权重会被迅速覆盖,灾难性遗忘就来了;太小呢,模型根本学不动新数据。

LoRA 的 rank 设的 64。rank 控制低秩矩阵的表达能力。rank 太低,微调效果差;rank 太高,计算量上去了,而且容易过拟合。我当时用的 QLoRA,所以还涉及 4-bit 量化的配置。

“那你怎么评估微调出来的模型?”

这是个开放性问题。我分了三层:

  • 自动化指标:在验证集上算 loss 和 perplexity,这是基础门槛。
  • 任务指标:针对下游任务算准确率、F1 这些。比如我做的文本分类任务,就看分类准确率有没有提升。
  • 人工评估:生成式任务,光看指标不够。我会自己看生成样例,从相关性、逻辑连贯性、格式遵循度几个维度打分。

这里面试官没追问,算是过了。

QLoRA

QLoRA 这块问得比较细。

我说的核心思路是:QLoRA = 4-bit NormalFloat 量化 + Double Quantization + LoRA。关键点是,量化只针对基础模型权重,LoRA 的 adapter 权重还是用 BF16 存。这样显存占用只有原来的一半左右,但效果能逼近全参数微调。

“Agent 的架构你了解吗?”

这块我知道一些,但不算特别深。我画了个简单的图来解释:

Agent 核心就三件事:规划(下一步做什么)、记忆(之前做了什么、有什么知识)、工具调用(怎么跟外部交互)。

然后他顺着问:

“ReAct 和 CoT 的区别?”

这个我比较熟。

CoT(Chain of Thought)是“想清楚了再回答”,就是让模型一步步推理,最后输出答案。整个过程是线性的,推理过程和最终输出是分开的。

ReAct(Reason + Act)是“边想边做”。每一步都是“思考 → 行动 → 观察结果 → 再思考”。它更适合需要和外部环境交互的任务,比如查资料、调用 API。

CoT 适合纯推理问题,ReAct 适合需要行动反馈的问题。

“记忆系统怎么设计?”

这个问题我开始有点虚了。我说了短期记忆和长期记忆的区分。

短期记忆就是当前的对话上下文,存的是最近几轮交互。长期记忆需要外部向量数据库,把历史信息 embedding 后存进去,需要的时候做相似性检索。

面试官追问了检索策略,我说了 RAG 那套,结合相似度阈值和 top-k 召回。

致命问题来了:“对GPU底层计算有了解吗?”

到这里我开始冒汗了。

我说了解一些 CUDA 编程的基础,知道 kernel 函数、线程块的概念。但说实话,我对底层算子优化、Tensor Core 的具体指令、L2 Cache 的管理这些,真不熟。

面试官很温和:“没关系,那KV Cache了解吗?”

我:???

KV Cache

这个我真没深入用过,只能硬着头皮说原理。

Transformer 推理的时候,decoder 是自回归的,每生成一个新 token,都要重新计算前面所有 token 的 Key 和 Value。这显然很蠢。KV Cache 就是把之前算好的 K 和 V 存起来,新 token 只算自己的 Q,然后跟缓存里的 K、V 做 attention。

这样复杂度从 O(n²) 降到 O(n)。

面试官点了点头,没继续追问。但我心里清楚,这块我答得不够深。比如显存怎么管理、PageAttention 是怎么回事、连续批处理怎么做,这些都没能展开说。

手撕代码:优先级任务调度

最后一道手撕题。

题目大概是:实现一个任务调度器,任务有优先级和执行时间,要求按优先级调度,同优先级按提交顺序。

这题不算难,我用优先队列(堆)实现的。但写的时候还是有点紧张,边界条件差点漏了。

大概逻辑就是:
维护一个时间戳,每次从堆顶取出优先级最高的任务执行
执行完后时间推进,然后继续取下一个

一面结束后没有反问环节,直接进入二面。我连水都没来得及喝一口。

二面:综合面,反而更紧张?

二面面试官明显风格不同,更像综合面 + HR面的混合体。

“自我介绍,以及你报的哪个岗位?”

我又来了一遍自我介绍。然后明确说了是 AI infra 训推方向。

“针对这个岗位,你有什么优势?”

这个问题我觉得是全场最关键的一题。

我的回答分了三条线:算法理解能力(知道模型怎么训、为什么这么训)、工程落地能力(Docker、K8s、推理服务部署都做过)、性能意识(训练的时候就会关注吞吐量和显存占用,不是只管 loss 下降)。

说实话第三条是临时加的,因为一面让我意识到,这个岗位对底层性能非常看重。

“为什么从福大转到杭电?”

这个问题有点私人。我如实说了:研究方向更匹配,导师的项目跟大模型相关,而且杭州的互联网氛围更好。

面试官看起来接受了。

“美赛经历”

我简单说了下美赛的建模题,用机器学习做预测,拿了什么奖。这块不是重点,一两句带过。

“说说华为的价值观”

这道题我真没想到。

说实话,我背过,但背得不太熟。我说了“以客户为中心,以奋斗者为本,长期艰苦奋斗”这些。面试官听了没说什么,但我感觉他们更想听到的是我怎么理解这些价值观,而不是背诵原文

“你来实习的话,期待是什么?”

我说了三点:想接触真正的千卡、万卡训练集群(学校没这条件);想把训练和推理的整套 pipeline 跑通;想跟高水平的人学东西。

最后是一些闲聊,还挺愉快的

聊了聊杭州的生活、研究方向的前景这些。但说实话,我一直很紧张,因为一面的技术问题还在我脑子里打转。

二面结束后,面试官说:“上一个面试官没留什么问题。”——这话让我有点慌。不知道是没问出问题,还是问题都答上来了所以没什么可留的。

总结一下,给后来人一些建议

这次面试让我意识到几个事:

第一,AI infra 岗真的不只看算法。 模型结构、训练技巧只是基础。GPU 架构、显存管理、推理优化这些硬核的底层知识,才是区分度所在。KV Cache、PageAttention、Continuous Batching、FlashAttention——这些名词不能只知道是什么,得知道怎么实现、有什么 trade-off。

第二,项目经历要被挖得很深。 每个参数为什么这么设、遇到过什么坑、怎么解决的,都要准备到细节层面。光是“我用 QLoRA 微调了 Qwen”这一句话,会被追问出十几个子问题。

第三,手撕代码还是躲不掉。 算法题不算难,但要在高压环境下写对,还是需要平时多练。

我把面试中涉及的核心知识点整理成了一张图,方便大家对照查漏补缺:

讲真,面试官最后问“你还有什么问题吗”的时候,我真想问一句:“您觉得我哪里需要补?”

但没好意思开口。

现在复盘下来,底层 GPU 计算和推理优化是我的明显短板。接下来的时间,得好好补补这块了。

这篇复盘写出来,一方面是帮自己梳理,另一方面也是给想冲这个方向的同学一个参考。AI infra 这个方向确实难,但也确实有意思。

如果你也在准备大模型面试,欢迎转发、收藏。 踩过的坑,能少一个人踩就少一个人踩吧。


这篇复盘内容基于真实面试经历,部分技术细节经过润色和补充,希望对你有帮助。

如果你对这个方向感兴趣,评论区聊聊你面试遇到过最“离谱”的问题是什么?

如果你觉得这篇文章对你有启发,欢迎转发给身边同样对技术较真的朋友。

算法这条路,一个人走得快,一群人走得远。

2026年求职群和升学群成立

价格:50元(每天不到1分钱) 立减25!特惠仅25元

时长:一年(从你加入的时刻算起)

加入方式:扫码下方二维码或者点击阅读原文,即可进入AIGC算法求职群(知识星球)

建议:进群后,推荐下载知识星球APP使用,同时也可使用小程序或者知识星球公众号进行使用,可以发帖/提问/交流/回答,并可以快速访问群里的资源。

希望这个群可以让你少走一些弯路

扫码进群