AI越强,深度学习基础为什么反而更重要?
现在,AI Agent已经可以帮我们搜索论文、整理资料、生成代码,甚至快速搭建一个完整实验。
但越是这样,一种能力反而越稀缺:判断。
这个研究问题是否真的成立?
一个模型为什么有效?
Loss下降是否代表学到了正确能力?
一个新模块解决的是表示问题、优化问题,还是仅仅增加了参数?
FLOPs降低,为什么真实速度可能没有提升?
一个Idea究竟值得投入一个月,还是应该先用一个最小实验否定它?
很多人学过深度学习,也学过CNN、Transformer、生成模型和强化学习,但真正进入科研之后,仍然会遇到一个问题:知识很多,却无法形成可以用于研究的结构。
模型名称不断变化,但它们背后的很多基础问题从未改变:
数据如何构成学习信号;
模型学习什么表示;
信息如何在网络中流动;
梯度如何分配责任;
训练为什么稳定或失败;
推理过程如何产生结果;
复杂度能否在真实硬件上转化为速度;
实验是否真的验证了研究主张。
因此,我们设计了这次:
7天深度学习第一性原理研讨班
我们更希望帮助参与者建立一套可以迁移到:
大语言模型;
扩散模型与Flow Matching;
强化学习;
世界模型;
具身智能;
未来尚未出现的新模型的深度学习科研底座。
第7天还会专门讨论一个很多课程忽略的问题:
在写代码之前,如何从参数量、FLOPs、显存、复杂度、硬件瓶颈与加速上界出发,判断一个Idea是否值得做?
优秀研究者并不是不需要实验。
真正的区别在于,他们能够在实验前:
更快识别主导问题;
建立合理的理论上界;
发现隐藏成本;
设计最小验证;
更早淘汰不成立的方向。
工具会不断升级,但判断问题、理解机制和设计实验的能力,不会因为模型更新而过时。
7月25日—7月31日。
从知道更多模型,走向真正理解模型。
从快速执行,走向高质量判断。
#深度学习
#人工智能
#机器学习
#AI科研
#科研方法
#研究生
#计算机学习
夜雨聆风