乐于分享
好东西不私藏

4:《NOI选手如何做LMCC第二轮试题》

4:《NOI选手如何做LMCC第二轮试题》
本文由WorkBuddy根据逐字稿生成,直播于8月11日15点。不构成学习建议,深度学习请去看回放链接:https://lmcc.ccf.org.cn/101/1010/10297.html
文末增加交流群,专门交流LMCC青少组,欢迎想要了解学习的朋友们。

💡 一句话导读:黄志刚老师(CCF 会员、指导学生 IOI 金牌 2 枚 / NOI 金牌 10 枚)从 NOI 选手视角,讲清两件事——① LMCC 与信息学竞赛到底有何不同;② 大模型基础内容(AI 概念链、训练关键技术、Transformer、BERT/GPT、采样策略)及配套真题。

一、开场与讲师介绍

主持人开场:黄志刚老师是 CCF 会员、WC T 委员,曾获市级骨干教师、市级学科带头人等荣誉,在省级中小学教师教学技能大赛中获一等奖;指导学生获 IOI 金牌 2 枚、NOI 金牌 10 枚、银牌 15 枚、铜牌 6 枚,60 余人次获 NOIP 一等奖。今天黄老师讲前两个核心内容(LMCC 与竞赛区别、大模型基础),第三块留到明天由另一位同学分享。

二、LMCC 与信息学竞赛的区别

核心定位:AI 评价体系不是取代传统信息学竞赛,而是补充与延伸。计算机从机器语言→高级语言→过程式→面向对象,当前正处于"确定性→概率性"的重大转变节点。对教练而言,要在原有认知上补充机器学习与 AI 的理解。

  • NOI
    :强调算法思维培养,靠大量练习建立系统问题求解能力,体系含 C++、数据结构、算法、数学。
  • LMCC
    :中国计算机学会面向大模型时代推出的新型人才评价体系,核心能力= 理解原理 + 应用模型(上下文学习、指令微调需动手练)。NOI 选手因有前期经验,对"本质原理"类内容上手更快。

LMCC vs NOI · 核心对比NOI 信息学竞赛• 造轮子:自己写代码处理问题• 确定性 / 精确性 / 可证明• 经典算法设计 + 数学• 大量练习建立思维• C++ / 数据结构 / 算法学习目标:问题求解能力LMCC 大模型认证• 用轮子:理解后用现有工具• 概率性 / 不确定性 / 统计• 基于数据的学习 + 模型应用• 理论 + 项目实践结合• 理解原理 + 动手调模型学习目标:AI 应用能力✅ 两者互为补充:确定性 ↔ 概率性,是面向未来的"双向能力"

三、LMCC 大纲的「四层」定位

黄老师把大纲(共 12 个模块)按自己的理解梳理成 4 层,线索清晰:

AI 概念链 + LMCC 大纲四层AI 概念链(包含关系):人工智能 ⊃ 机器学习 ⊃ 深度学习 ⊃ 大模型① 背景概念层:AI 基础 + 大模型基础(处于 AI 哪个阶段?)② 模型原理层:内部结构 + 如何训练(为什么能理解语言?)③ 后训练技术层:变助手 / 更安全(上下文学习·指令微调·RLHF)④ 部署推理应用层:完成任务 → 复杂任务 → 智能体

四、第一层:背景与概念(含 4 道真题)

机器学习:基于大量数据生成数学模型并预测的过程——模型可理解为"函数"(Functions describe the world)。分三类:

  • 监督学习
    :用带标签样本学习;
  • 无监督学习
    :无标签,模型自己发现数据中有趣的结构(如聚类);
  • 强化学习
    :通过交互、最大化奖励信号来学习。
真题
答案
关键判断
AI 与机器学习说法
B
机器学习是 AI 分支,靠数据训练模型
属于无监督学习的任务
C
按行为特征给用户分群(无标签);A/B/D 都有标签=监督
有/无监督描述
B
分类/回归=有监督,聚类=无监督
对比学习(自监督)
B
拉近相似/推远不相似,样本间对比,非必须监督场景

五、深度学习关键技术突破

从机器学习演进到深度学习(2006 深度信念网络),强大源于几项关键技术。黄老师重点拆解了三件"训练基础设施":

训练三大关键技术① 反向传播链式法则:从后往前一次反向扫描,算出所有梯度(梯度=损失对各参数的变化率)② 激活函数Sigmoid 导数≤0.25 → 多层连乘→梯度消失ReLU=max(0,z) 解决消失③ 批归一化 BatchNorm(全班身高类比)• 量全班平均身高与标准差,平移到「均值0、方差1」维度• 不再看绝对身高,只看"高/矮几个标准差",层间标准一致• 留 γ、β 学习参数,保住各班表达力;放大学习率、训练更稳

此外还有 Dropout(正则化防过拟合)、层归一化 LN(单条样本内部特征标准化,与 BN 的"全班"相对)、MLP / CNN / RNN 等。参数规模从百万→千亿→万亿,带来能力涌现——"不理解也能胜任",是黄老师最着迷之处。

六、大模型结构与 Transformer

大模型结构起点是 Tokenizer(分词→编号)+ Embedding(编号→语义向量),再堆叠 Transformer Block。Transformer 左编码器、右解码器,含多头注意力、位置编码、残差连接、层归一化,主流采用自回归解码(一个字一个字吐 token)。

大模型结构 · Transformer · 采样策略Tokenizer 分词→编号Embedding 编号→向量Transformer Block编码器+解码器堆叠Transformer 关键部件• 多头注意力(不同角度理解)• 位置编码 / 残差连接 / 层归一化• 自回归:按前文生成下一 token生成时的采样策略• Softmax:把分数变成「和为1」的概率• 贪心:永远取概率最高的 token• Top-K:取前 K 个再随机选一个• Top-P(核采样):累计概率达 P 再随机选• 温度 T:调随机性(T↑更发散,T↓更确定)

七、自然语言发展与 BERT / GPT 双分支

发展脉络:统计方法 → 词嵌入 → 编码架构 → Transformer(2017《Attention is all you need》)。Transformer 之后分出两支:

  • BERT(2018)
    :仅用编码器 → 双向语言理解;
  • GPT
    :仅用解码器 → 单向生成;
  • 两者都采用"预训练 + 微调"范式,且可多模态(文本/图像/视频)。

发展史时序 + BERT/GPT 双分支🕒 时序真题(选B):统计模型 → 神经网络语言模型 → RNN → 预训练模型 → BERT → GPT → 大语言模型BERT(2018)• 仅用 编码器 Encoder• 双向语言理解里程碑题:GPT-1 "仅编码器"说法 ❌GPT• 仅用 解码器 Decoder• 单向生成式同用「预训练+微调」范式✅ 技术路线"一左一右":纯编码 vs 纯解码,都源自 Transformer

八、Transformer 真题与两大注意力

QKV 真题(选 B):Query 是"查询"、Key 是"关键词"、Value 是"目标值";注意力分数由 Q·K 点积得,经 Softmax(映射到 0~1,非 -1~1)后对 V 加权求和。

自注意力 vs 交叉注意力:唯一区别看 Q 从哪来——

  • 自注意力
    :Q/K/V 来自同一序列内部互相找关系;不限于编码器,解码器也能用;
  • 交叉注意力
    :Q 来自一个序列、K/V 来自另一序列(跨序列找关系);不限于解码器。

残差连接:解决梯度消失的"短路支路"——输出 = F(x) + x,反向传播时梯度有两条回传路径。

自注意力 vs 交叉注意力 + 残差连接自注意力 Self-AttnQ / K / V 同来源同一序列内部找关系编码器 / 解码器 都可用交叉注意力 Cross-AttnQ 与 K/V 不同来源两序列之间找关系不限于解码器残差连接 Residual:输出 = F(x) + x• 原网络:x → F(x),深层梯度传到前面≈0(学不到)• 加短路支路 x 跨接:反向传播有两条回传路径,缓解梯度消失

九、Q&A 与学习资源

  • 资源推荐(有梯度)
    :① LMCC 官网资料合集(大纲+例题+习题);② 大模型教育提纲;③ 本次讲座回放(含李超老师的 RAG 案例);④ 案头书《大语言模型》(赵鑫/文继荣,高教社);⑤ B 站"大白话讲 Transformer";⑥ 手工梯度下降板书视频;⑦ 网页版 AI 训练小游戏(需翻墙,带完整 AI 流程)。
  • 学时建议
    :黄老师近 50 岁仍在学,学生仅 3~4 次集中学习即取得不错成绩;从原理本质入手、以兴趣点切入,别为考试而考试,不焦虑。
  • 报名时间
    :截止 8 月 25 日(NOIP 一等奖等可享优惠);开源项目在推荐课程代码里(含小型训练、梯度下降示例)。
  • NOI 与 LMCC 并行
    :因人而异,由主导教练把握;浙江未来或把相关概念纳入高考考纲,建议提前学。

✅ 核心方法论:LMCC 与 NOI 是"确定性 ↔ 概率性"的双向能力,互为补充。NOI 选手的算法与原理底子,是上手 LMCC 的天然优势;"先开枪后瞄准"——先报名、先迈步,再以赛促学。

整理自黄志刚老师《从 NOI 选手角度看 LMCC 大纲》直播逐字稿 · 内容忠实于原讲;现场口播的数值与运行结果为近似值,已按原话保留。

交流群,失效联系:wswrlm