乐于分享
好东西不私藏

大疆机考算法岗8月14日笔试题与解析

大疆机考算法岗8月14日笔试题与解析

写在前面

本次给大家带来2026年8月14日大疆算法岗笔试题的2道题,本场机考题目可在咱们平台上在线刷题。

第一题:选择题

第二题:判断题

塔子哥的配套刷题网站:codefun2000.com

题号
题目
难度(对标leetcode)
核心做法
1
选择题
中等
选择题
2
判断题
中等
判断题

第1题-选择题

1.单选题

1、MQA、GQA、MLA 与推理期 KV cache 的关系,正确的是?{{ select(1) }}

  • 三者只抬高训练吞吐,对推理时 KV cache 占用几乎没有影响
  • MLA 精度必然远低于 MQA,落地时基本不可用
  • MQA 让所有 head 共用一组 K/V,GQA 按组共享,MLA 用低秩潜变量压缩 K/V,三者都以压缩 KV cache 显存为主要目标
  • MQA / GQA / MLA 的数学形式完全相同,差别只在论文命名

2、关于 Whisper 模型,下列哪项正确?{{ select(2) }}

  • 架构被限定为纯 CTC,禁止使用自回归解码
  • 训练数据只覆盖 LibriSpeech,不包含网页字幕语料
  • 在约  万小时网页字幕上做弱监督多任务训练,输入 log-Mel 频谱,零样本多语种 ASR 能力较强
  • 只能输出转写文本,不具备翻译能力

3、Qwen-VL / InternVL 一类模型的 dynamic resolution,正确理解是?{{ select(3) }}

  • 依靠 StyleGAN 先“生成”高清图,再送进 ViT
  • 所有图像统一强制缩放到 ,不做动态分块
  • 官方明确不支持超过 K 分辨率的输入
  • 按图像纵横比选择最接近的分块方案,使 patch token 数量与内容量匹配,从而在任意分辨率下保留细节

4、Transformer 中 pre-LN 与 post-LN,哪项说法成立?{{ select(4) }}

  • pre-LN 与 post-LN 可证明恒等,替换后训练动态不变
  • 深层堆叠时 post-LN 更稳,因此是当前大模型默认选择
  • pre-LN 把 LayerNorm 放在残差分支之前,训练数值更稳,也被大模型更广泛采用
  • 使用 pre-LN 时必须配合 warmup,而 post-LN 绝对不需要 warmup

5、DINOv2 特征与 SAM 特征在下游任务上的差异,正确的是?{{ select(5) }}

  • DINOv2 语义可分性强,常作分类/检测/分割 backbone;SAM 对 mask 边界更友好,更适合可提示分割
  • 两套特征空间完全对齐,下游可直接互换权重
  • DINOv2 只能做聚类可视化,不能作为可微调 backbone
  • SAM 更擅长 ImageNet 分类,DINOv2 更擅长交互式抠图

6、RAG 与 long-context in-context 的对比,哪项正确?{{ select(6) }}

  • long-context 已全面淘汰 RAG,工业界不再做检索增强
  • RAG 按需检索短证据写入 prompt,通常更能控制推理成本;把大段知识直接塞进超长上下文成本更高,也更易出现 lost-in-the-middle
  • RAG 只能检索纯文本,无法扩展到图像或表格证据
  • 两条路线数学同构,可以无条件互换

7、SigLIP 相对 CLIP 最关键的差异是?{{ select(7) }}

  • SigLIP 放弃图文对比,改走 masked image modeling
  • SigLIP 只对中文图文对有效,英文语料无效
  • 两者损失形式相同,差别只在学习率调度曲线
  • 用 sigmoid pairwise loss 替换 InfoNCE,从而不必对 batch 内全部负样本做 softmax 归一化,更利于放大 batch

8、ACT(Action Chunking Transformer)一次预测未来  步动作块,主要动机是?{{ select(8) }}

  • 应固定  逐步预测;chunk 越长控制一定越差,因此禁止 chunk
  • 一次输出未来  步动作块,可缓解逐步滚动带来的累积误差与非马尔可夫性,再配合 temporal ensemble 提升平滑度
  • ACT 规范要求严格单步输出,不允许 chunk
  • chunk 只对离散分类动作有效,连续控制场景无效

9、AdamW 相对 Adam 的关键改进是?{{ select(9) }}

  • AdamW 不再维护二阶矩,以此换取显存
  • AdamW 只适用于图像分类,序列模型应禁用
  • AdamW 等价于 Adam 再加 L2,只是换了名字
  • AdamW 将 weight decay 从梯度更新中解耦并直接作用于参数,与 Adam+L2 不等价,大模型训练通常更稳

题解

一、单选题

1

答案:C

MQA 全 head 共享 K/V,GQA 分组共享,MLA 低秩压缩 K/V,目标都是压推理期 KV cache。三者结构并不等价;MLA 也不是“精度必然远差于 MQA”;它们主要影响推理显存,而非“只改训练吞吐”。

2

答案:C

Whisper 在大规模网页字幕上做弱监督多任务,输入 log-Mel,具备较强零样本多语种 ASR,并支持识别+翻译;编码器-自回归解码器,不是纯 CTC;也不是只训 LibriSpeech。

3

答案:D

Qwen-VL / InternVL 等用动态分块匹配纵横比与 patch 量,以保留任意分辨率细节;不是死锁 ,也不是靠 GAN“生成高清”,更不是官方禁止 >1K。

4

答案:C

pre-LN:Norm 在残差支路内部(进 Attention/FFN 前);post-LN:Norm 在残差相加后。pre-LN 更深时更稳,是主流大模型常见选择。warmup 并非 pre-LN 强制项;二者数学不等价;深层 post-LN 更容易不稳。

5

答案:A

DINOv2 提供通用语义特征,适合做检测/分割等 backbone;SAM 面向可提示分割,边界更友好。二者用途不同,不能互换,也不是“DINOv2 只能聚类 / SAM 更适合分类”。

6

答案:B

RAG 按需检索短证据,通常更省上下文与成本;超长上下文直接塞知识更贵,且易 lost-in-the-middle。long-context 并未淘汰 RAG;两者也非数学等价;RAG 亦可扩展到多模态证据。

7

答案:D

CLIP 用 InfoNCE(batch 内 softmax);SigLIP 用 sigmoid pairwise,摆脱全局 softmax,更易放大 batch。它仍是对比学习家族,并非改成 MIM,也不是“只对中文有效”或“只换学习率”。

8

答案:B

ACT 一次预测连续  步动作块,减轻逐步自回归的误差累积与非马尔可夫影响,再配 temporal ensemble 更平滑。chunk 可用于连续控制;并非禁止 chunk,也不是  最优。

9

答案:D

AdamW 把 weight decay 从梯度更新解耦并直接作用于参数,与 Adam+L2 不等价,大模型训练更常见。它仍维护矩估计;并非“只对分类有效”或“改名版 Adam+L2”。

第2题-判断题

1、A100 的 Tensor Core 已将 FP8 作为与 FP16 同级的原生一等加速精度,因此不必等到 H100。{{ select(1) }}

2、相对 DUST3R,MASt3R 增加了 matching head,从而更好支持大规模场景的多视图重建与跨视图特征匹配。{{ select(2) }}

3、Diffusion Policy 在推理时只需单步直接回归动作,完全不需要多步 denoise 即可得到动作 chunk。{{ select(3) }}

4、Chain-of-Thought 让模型先输出中间推理再给答案,在算术、常识和多步推理任务上通常能带来提升。{{ select(4) }}

5、DataComp、LAION、DFN 都属于面向 CLIP 类预训练的开源数据构建或数据筛选方案。{{ select(5) }}

题解

答案+解析

1、答案:否

解析:A100 Tensor Core 支持 FP16/BF16/TF32/INT8;硬件原生把 FP8 作为一等加速精度是从 H100 起。题干把 FP8 提前安到 A100 上,因此错误。

2、答案:是

解析:MASt3R 在 DUST3R 思路上增加 matching head,强化跨视图匹配,更适配大规模多视图重建。

3、答案:否

解析:Diffusion Policy 学习动作分布的 score/去噪过程,推理通常需要多步 denoise 才能得到动作 chunk,并非单步直接回归即可。

4、答案:是

解析:CoT 促使模型写出中间步骤,对算术、常识、多步推理类任务通常有帮助。

5、答案:是

解析:LAION 是大规模图文数据;DataComp、DFN 侧重数据筛选/过滤,均服务 CLIP 类预训练。