写在前面
本次给大家带来2026年8月14日大疆算法岗笔试题的2道题,本场机考题目可在咱们平台上在线刷题。
第一题:选择题
第二题:判断题
塔子哥的配套刷题网站:codefun2000.com
第1题-选择题
1.单选题
1、MQA、GQA、MLA 与推理期 KV cache 的关系,正确的是?{{ select(1) }}
三者只抬高训练吞吐,对推理时 KV cache 占用几乎没有影响 MLA 精度必然远低于 MQA,落地时基本不可用 MQA 让所有 head 共用一组 K/V,GQA 按组共享,MLA 用低秩潜变量压缩 K/V,三者都以压缩 KV cache 显存为主要目标 MQA / GQA / MLA 的数学形式完全相同,差别只在论文命名
2、关于 Whisper 模型,下列哪项正确?{{ select(2) }}
架构被限定为纯 CTC,禁止使用自回归解码 训练数据只覆盖 LibriSpeech,不包含网页字幕语料 在约 万小时网页字幕上做弱监督多任务训练,输入 log-Mel 频谱,零样本多语种 ASR 能力较强 只能输出转写文本,不具备翻译能力
3、Qwen-VL / InternVL 一类模型的 dynamic resolution,正确理解是?{{ select(3) }}
依靠 StyleGAN 先“生成”高清图,再送进 ViT 所有图像统一强制缩放到 ,不做动态分块 官方明确不支持超过 K 分辨率的输入 按图像纵横比选择最接近的分块方案,使 patch token 数量与内容量匹配,从而在任意分辨率下保留细节
4、Transformer 中 pre-LN 与 post-LN,哪项说法成立?{{ select(4) }}
pre-LN 与 post-LN 可证明恒等,替换后训练动态不变 深层堆叠时 post-LN 更稳,因此是当前大模型默认选择 pre-LN 把 LayerNorm 放在残差分支之前,训练数值更稳,也被大模型更广泛采用 使用 pre-LN 时必须配合 warmup,而 post-LN 绝对不需要 warmup
5、DINOv2 特征与 SAM 特征在下游任务上的差异,正确的是?{{ select(5) }}
DINOv2 语义可分性强,常作分类/检测/分割 backbone;SAM 对 mask 边界更友好,更适合可提示分割 两套特征空间完全对齐,下游可直接互换权重 DINOv2 只能做聚类可视化,不能作为可微调 backbone SAM 更擅长 ImageNet 分类,DINOv2 更擅长交互式抠图
6、RAG 与 long-context in-context 的对比,哪项正确?{{ select(6) }}
long-context 已全面淘汰 RAG,工业界不再做检索增强 RAG 按需检索短证据写入 prompt,通常更能控制推理成本;把大段知识直接塞进超长上下文成本更高,也更易出现 lost-in-the-middle RAG 只能检索纯文本,无法扩展到图像或表格证据 两条路线数学同构,可以无条件互换
7、SigLIP 相对 CLIP 最关键的差异是?{{ select(7) }}
SigLIP 放弃图文对比,改走 masked image modeling SigLIP 只对中文图文对有效,英文语料无效 两者损失形式相同,差别只在学习率调度曲线 用 sigmoid pairwise loss 替换 InfoNCE,从而不必对 batch 内全部负样本做 softmax 归一化,更利于放大 batch
8、ACT(Action Chunking Transformer)一次预测未来 步动作块,主要动机是?{{ select(8) }}
应固定 逐步预测;chunk 越长控制一定越差,因此禁止 chunk 一次输出未来 步动作块,可缓解逐步滚动带来的累积误差与非马尔可夫性,再配合 temporal ensemble 提升平滑度 ACT 规范要求严格单步输出,不允许 chunk chunk 只对离散分类动作有效,连续控制场景无效
9、AdamW 相对 Adam 的关键改进是?{{ select(9) }}
AdamW 不再维护二阶矩,以此换取显存 AdamW 只适用于图像分类,序列模型应禁用 AdamW 等价于 Adam 再加 L2,只是换了名字 AdamW 将 weight decay 从梯度更新中解耦并直接作用于参数,与 Adam+L2 不等价,大模型训练通常更稳
题解
一、单选题
1
答案:C
MQA 全 head 共享 K/V,GQA 分组共享,MLA 低秩压缩 K/V,目标都是压推理期 KV cache。三者结构并不等价;MLA 也不是“精度必然远差于 MQA”;它们主要影响推理显存,而非“只改训练吞吐”。
2
答案:C
Whisper 在大规模网页字幕上做弱监督多任务,输入 log-Mel,具备较强零样本多语种 ASR,并支持识别+翻译;编码器-自回归解码器,不是纯 CTC;也不是只训 LibriSpeech。
3
答案:D
Qwen-VL / InternVL 等用动态分块匹配纵横比与 patch 量,以保留任意分辨率细节;不是死锁 ,也不是靠 GAN“生成高清”,更不是官方禁止 >1K。
4
答案:C
pre-LN:Norm 在残差支路内部(进 Attention/FFN 前);post-LN:Norm 在残差相加后。pre-LN 更深时更稳,是主流大模型常见选择。warmup 并非 pre-LN 强制项;二者数学不等价;深层 post-LN 更容易不稳。
5
答案:A
DINOv2 提供通用语义特征,适合做检测/分割等 backbone;SAM 面向可提示分割,边界更友好。二者用途不同,不能互换,也不是“DINOv2 只能聚类 / SAM 更适合分类”。
6
答案:B
RAG 按需检索短证据,通常更省上下文与成本;超长上下文直接塞知识更贵,且易 lost-in-the-middle。long-context 并未淘汰 RAG;两者也非数学等价;RAG 亦可扩展到多模态证据。
7
答案:D
CLIP 用 InfoNCE(batch 内 softmax);SigLIP 用 sigmoid pairwise,摆脱全局 softmax,更易放大 batch。它仍是对比学习家族,并非改成 MIM,也不是“只对中文有效”或“只换学习率”。
8
答案:B
ACT 一次预测连续 步动作块,减轻逐步自回归的误差累积与非马尔可夫影响,再配 temporal ensemble 更平滑。chunk 可用于连续控制;并非禁止 chunk,也不是 最优。
9
答案:D
AdamW 把 weight decay 从梯度更新解耦并直接作用于参数,与 Adam+L2 不等价,大模型训练更常见。它仍维护矩估计;并非“只对分类有效”或“改名版 Adam+L2”。
第2题-判断题
1、A100 的 Tensor Core 已将 FP8 作为与 FP16 同级的原生一等加速精度,因此不必等到 H100。{{ select(1) }}
是 否
2、相对 DUST3R,MASt3R 增加了 matching head,从而更好支持大规模场景的多视图重建与跨视图特征匹配。{{ select(2) }}
是 否
3、Diffusion Policy 在推理时只需单步直接回归动作,完全不需要多步 denoise 即可得到动作 chunk。{{ select(3) }}
是 否
4、Chain-of-Thought 让模型先输出中间推理再给答案,在算术、常识和多步推理任务上通常能带来提升。{{ select(4) }}
是 否
5、DataComp、LAION、DFN 都属于面向 CLIP 类预训练的开源数据构建或数据筛选方案。{{ select(5) }}
是 否
题解
答案+解析
1、答案:否
解析:A100 Tensor Core 支持 FP16/BF16/TF32/INT8;硬件原生把 FP8 作为一等加速精度是从 H100 起。题干把 FP8 提前安到 A100 上,因此错误。
2、答案:是
解析:MASt3R 在 DUST3R 思路上增加 matching head,强化跨视图匹配,更适配大规模多视图重建。
3、答案:否
解析:Diffusion Policy 学习动作分布的 score/去噪过程,推理通常需要多步 denoise 才能得到动作 chunk,并非单步直接回归即可。
4、答案:是
解析:CoT 促使模型写出中间步骤,对算术、常识、多步推理类任务通常有帮助。
5、答案:是
解析:LAION 是大规模图文数据;DataComp、DFN 侧重数据筛选/过滤,均服务 CLIP 类预训练。
夜雨聆风