夜雨聆风学习资料网

ARTICLE · 1036076

从数据到论文 科研数据分析 AI 算法实战

从数据到论文 科研数据分析 AI 算法实战
OPEN COURSE · 23 章完整大纲全新课程

从数据到论文科研数据分析 AI 算法实战

代码交给 AI,研究问题、方法选择、结果判断与成果交付掌握在自己手里

北京场 · 9 月 11 日—13 日杭州场 · 10 月 16 日—18 日

20 章

正课

3 章

课前预习

17 类

研究任务

// CORE MESSAGE

许多科研人真正卡住的,不是不会写代码,而是下面这些问题。

AI 可替您写代码、跑模型、出图,但结果为什么可信,最终必须有人说得清楚。这门课教的不是"某个工具怎么用",而是面对任何新工具——怎么判断它强在哪、会在哪骗您、结果该怎么验。

许多科研人真正卡住的,不是不会写代码,而是下面这些问题:

数据拿到手,到底能不能直接分析?

组间比较、回归、生存分析、机器学习,自己的问题到底该用哪一种?

p 值很小,就代表结果很重要吗?

AI 跑出来的结果看着很漂亮,怎么知道它有没有做错?

机器学习 AUC 很高,是模型真的好,还是发生了数据泄漏?

病历、涉密数据、未发表数据不能上云,又怎么使用 AI?

《从数据到论文》就是围绕这些问题设计的。

考虑到许多学员希望先把 Python 基础补齐,课程把正式三天课程之前的 Python、NumPy、Matplotlib 拆成3 章课前预习;三天正课不要求手写 Python,也不推导数学公式。

代码编写、运行、绘图和重复性工作交给 AI 智能体;学员真正要掌握的是四件事:

数据能不能用

方法该怎么选

结果能不能信

成果怎么交出去

01 课程价值
这三天不教什么,教什么

这三天不教 Python 语法,也不从数学公式开始推导。代码编写、运行、绘图和重复性工作交给 AI 智能体;您负责提出问题、选择方法、检查结果并签字放行。

这三天不讲概念空谈,全部围绕真实科研场景展开:选题检索、数据清洗、出版级图表,每个环节都给出拿来即用的完整工作流。

课前 3 章预习解决"代码看不懂心里没底" 的问题;正课解决 "方法不会选、结果不可信、成果不能交" 的问题。

02 课前预习
先把 Python 科研计算基础补齐

许多人来学算法时,对 Python 仍然比较执着:如果完全没见过 Python、NumPy 和 Matplotlib,哪怕 AI 能把代码写出来,心里也不踏实。

所以正式三天课程之前,增加 3 章课前预习:

▍第一章 Python 基础学习

环境、变量、循环、数据结构、条件、函数、模块、类、文件读写、异常处理——能看懂最常见的 Python 程序结构。

▍第二章 NumPy 科学计算基础

数组、索引切片、运算、广播、统计、筛选、变形与拼接——能理解科研数据在程序里怎样参与计算。

▍第三章 Matplotlib 科研绘图基础

折线、散点、柱状、直方图、坐标轴、图例、多子图与保存——能理解程序怎样把数据变成科研图表。

这 3 章的目标不是让您靠手写代码完成后面的所有项目,而是先建立基本代码感。进入正式课程后,复杂程序仍然主要由 AI 智能体完成,您把精力放在研究问题、数据含义、方法选择、结果判断和科研表达上。

03 三天主线
三天课程主线

整门课分为三天,从智能体环境到数据处理到深度学习与图像算法再到论文写作,主线一气呵成。中途加入也能听懂,但建议从头听起——开场会把这套体系的地基打好。

DAY 1

搭环境 · 数据体检 · 统计与机器学习(第 4—11 章)

DAY 2

规范建模 · 论文配图 · 深度学习与图像(第 12—18 章)

DAY 3

本地隐私 · 知识库 · 模型网页 · 论文自动化(第 19—23 章)

AI 智能体数据分析分析与算法应用实战

课前 3 章 + 三天正课 20 章 · 共 23 章完整大纲。

从数据清洗到论文成稿,每个环节给出完整工作流统计分析、机器学习、图像、文本、本地分析、知识库全覆盖。

23 章

17 类

3 章预习

/// COMPLETE OUTLINE · 23 CHAPTERS

课前预习 · 3 章 Python 基础

01
Python 基础学习

Python 的应用场景

环境安装配置、print 使用、运算符和变量、循环、列表 / 元组 / 字典、if 条件、函数、模块、类的使用、文件读写、异常处理

▍ 学完能:看懂最常见的 Python 程序结构

02
NumPy 科学计算基础

NumPy 的作用:科研计算和机器学习离不开数组

创建数组、shape 与 ndim、索引切片、dtype 与 astype、四则运算与常用数学函数、广播机制、统计计算、条件筛选与布尔索引、reshape / T / concatenate

▍ 学完能:理解科研数据在程序里怎样参与计算

03
Matplotlib 科研绘图基础

Matplotlib 的作用:从数据到科研图表

figure 与 subplots、plot 折线图、scatter 散点图、bar 柱状图、hist 直方图、标题 / 坐标轴 / 图例 / 刻度、线型点型透明度、多子图布局、PNG / PDF 保存

▍ 学完能:理解程序怎样把数据变成科研图表

DAY 1 · 搭环境 · 数据清洗 · 统计与机器学习(第 4—11 章)

04
常见 AI 数据分析与算法落地案例分析

从"人写程序"到"人提需求、AI 编程":工作方式变化

统计分析 / 机器学习 / 深度学习分别解决什么问题

智能体的基本结构:大模型 + 工具 + 循环 + 验收

▍ 总原则:AI 负责干活,人负责科学判断与最终责任

05
AI 智能体开发环境搭建与配置

智能体的安装与登录、Windows / macOS 版本选择、工作空间概念

默认权限 vs 完全访问权限、哪些高风险操作必须人工确认

任务描述四要素:目标、输入、输出格式、约束条件

▍ 常见问题:安装与使用问题的排查思路

06
AI 智能体基础操作与分析技能包使用

技能包 = 给智能体安装一套"说明书、脚本、资源":SKILL.md / scripts / references / assets

自动记忆、全局规则、项目日志;并行子智能体

人机分工:说清目标 → 让技能执行 → 查看过程 → 检查输出 → 签字放行

▍ 课堂实操:299 名心衰患者数据,让智能体完成一次预测建模任务

07
研究数据体检、清洗与分析表构建

"拿到数据马上跑统计"是科研中最危险的习惯之一

原始文件到分析表的七道关:定 → 封 → 查 → 签 → 洗 → 验 → 报

伪装缺失、特殊编码 99 / 999 / −9、单位量级与合理范围检查

▍ 课堂实操:109 行公开糖尿病基线表整理成可分析数据包

08
组间比较与论文第一张结果图表

组间比较七步法:定 → 辨 → 查 → 选 → 算 → 验 → 报

两组比较:独立样本、配对数据、分类比例

多组比较:ANOVA / Welch ANOVA / Kruskal-Wallis;分类数据:卡方与 Fisher

▍ 课堂实操:7,276 名成人按 BMI 分四组比较肝硬度

09
回归分析与影响因素归因应用

回归五步法:定 → 算 → 读 → 验 → 报

线性回归:β 与 95%CI;Logistic 回归:OR 与 95%CI

Z-score 标准化系数:比较不同因素相对影响强弱

▍ 课堂实操:47,949 条社会调查记录:文化消费与幸福感的关系

10
生存分析与寿命预测应用

生存分析六步法:清 → 画 → 比 → 归 → 验 → 报

删失不是缺失:它告诉你"这个对象至少坚持到了第 X 天"

KM 曲线、Log-rank、Cox 比例风险回归:HR 与 95%CI 正确读法

▍ 课堂实操:299 名心衰患者随访数据:绘制 KM 曲线并比较两组

11
机器学习常用算法介绍与使用

训练集 / 验证集 / 测试集:监督 / 无监督 / 自监督学习

回归 / 分类 / 聚类;随机森林 / XGBoost / LightGBM 核心差异

SHAP 基本思想:模型为什么给出这个结果

▍ 课堂实操:768 人糖尿病数据,8 项体检指标预测是否患病

DAY 2 · 规范建模 · 论文配图 · 深度学习与图像(第 12—18 章)

12
机器学习建模全流程、模型评估与数据泄漏防护

规范建模主线:划分与封存 → 特征处理 → 交叉验证调参 → 测试集评价 → 解释与交付

分类评价:混淆矩阵、准确率、精确率、召回率 / 灵敏度、特异性、F1、ROC、AUC

数据泄漏:科研机器学习中最常见、最容易被忽略的问题

▍ 课堂实操:4,410 名骨折患者,用 113 个字段预测一年内死亡

13
AI 数据可视化与论文级配图应用

先明确研究问题,再决定画什么图

散点 / 折线 / 柱状 / 箱线图;相关系数热力图;误差棒 SD / SE / CI

回归森林图、KM 生存曲线与风险人数表、ROC 与 SHAP 贡献图

▍ 课堂实操:使用"科研作图"技能批量生成论文级图稿

14
深度学习基础与神经网络算法

深度学习能解决:图像识别、目标检测、分割、语音、文本与生成任务

单个神经元 → 多层网络 → Sigmoid / Tanh / ReLU 激活函数

梯度消失、损失函数、梯度下降、反向传播、Batch / Epoch / 优化器

▍ 课堂实操:神经网络游乐场:改变网络与数据,观察分类边界怎样变化

15
时间序列预测与前沿时序模型

预测任务先定义:用多长历史 / 预测多远未来

LSTM:记忆与门控思想;Transformer 自注意力是当前所有大模型的底层

时序基础模型 TSFM:从"每个任务重新训练"到"预训练模型迁移"

▍ 课堂实操:北京逐小时空气质量数据预测未来 PM2.5

16
卷积神经网络与图像分类项目实战

CNN 核心思想:局部感受野与权值共享;卷积核、步长、特征图、池化、Padding

经典架构演进:LeNet-5、VGG、ResNet、EfficientNet、ConvNeXt

Transformer 时代:ViT / DeiT / Swin;DINOv2 视觉基础模型

▍ 课堂实操:天气现象图像分类,使用预训练 EfficientNetV2-S

17
视觉基础模型与零训练分割计数应用

"分割一切"类模型:从专门训练到通用预训练模型

零训练分割:不给自己的数据重新训练,只用提示或目标描述完成分割

应用:医学细胞 / 农业病斑 / 遥感地块

▍ 课堂实操:显微图像细胞自动计数与面积占比统计

18
YOLO26 目标检测与图像分割项目实战

输出"是什么 + 在哪里";一阶段 vs 二阶段检测

YOLO26 基本结构:Backbone / Neck / Detect Head;mAP50 / mAP50-95

X-AnyLabeling 标注;矩形框 / 多边形分割标注;训练自己的模型

▍ 课堂实操:同一批蘑菇图片分别完成目标检测与实例分割

DAY 3 · 本地隐私 · 知识库 · 模型网页 · 论文自动化(第 19—23 章)

19
隐私数据与本地分析

病历、涉密数据、未发表数据和企业内部数据为什么不能直接上传云端

路线一:表格和数值分析不需要大模型理解原始数据时——云端智能体根据字段说明和少量示例开发程序,真实数据只在本机/内网运行

路线二:必须理解语义的文本任务——Ollama 部署本地大模型,原始文本不离开本机

▍ 课堂实操:只给前 10 行示例与字段规则,让智能体生成完整糖尿病建模程序

20
本地大模型部署与知识库问答系统

为什么要本地部署:隐私、稳定、长期使用与可控性

聊天模型、向量模型、向量数据库分别做什么

文档导入、解析、切分、向量化与索引;AnythingLLM 配置

▍ 课堂实操:把课程资料或自己的资料导入知识库

21
让模型变成 Gradio 网页并进行分享

Gradio 是什么:把已训练模型快速变成可操作网页

表格模型网页 + 图像模型网页两类

▍ 课堂实操:读取已训练好的糖尿病模型,制作本地预测页面

22
系统综述与 meta 分析自动化

完整主线:定义问题 → 检索与筛选 → 数据提取 → 统计合并 → 写作与核验

文献检索、去重、标题摘要初筛;逐篇全文核查与可追溯理由

RR/OR 等效应量计算;固定效应、随机效应与异质性;森林图

▍ 课堂实操:对照公开 Cochrane 综述,复算合并结果并比较

23
AI 智能体自动化流水线、多智能体协作与科研论文写作

从"会聊天"到"会干活":智能体怎样连续执行多步科研任务

把科研流程做成自动化流水线:执行 → 审查 → 交叉核验

多智能体论文审查:一个负责写作,一个负责数据一致性,一个负责引用 / 方法 / 逻辑核验

▍ 课堂实操:把三天课程产出的数据、图表和分析结果整理成完整方法与结果部分

04 课程特色
这门课特别适合科研人员

▍ 第一,先学够用的 Python,但不要求您先变成程序员

课前 3 章掌握够用的 Python、NumPy、Matplotlib 基础,后面看到代码不会完全陌生;但您也不需要先学半年 Python 才能开始做科研分析。复杂程序仍主要由智能体完成,您把时间放在研究问题、数据含义、方法选择、结果判断和结论边界上。

▍ 第二,不把"AI 一键出结果"当作卖点

科研最怕的不是程序慢,而是结果错了却不知道。课程从数据清洗开始就强调人工签字;到了机器学习,又专门讲数据泄漏、测试集、交叉验证和复现;到了 meta 分析,再回到原文逐项核对数据来源。

▍ 第三,用真实科研问题,而不是只用玩具案例

案例覆盖临床、公共卫生、社会调查、环境监测、图像与文献研究等不同类型,让您看到:换一个研究领域,底层的数据分析逻辑其实可以复用。如果带了自己的科研数据,课堂练习也可以直接替换成自己的数据来跑。

▍ 第四,既讲成熟方法,也带您看前沿模型应该怎么用于研究

课程会讲 LSTM、Transformer、时序基础模型、ViT、Swin、DINOv2 等前沿方向,但重点不是"追新模型"。真正要讨论的是:拿到一个新模型以后,怎样设计基线、怎样做外部验证、怎样看跨域性能、怎样把"用了新模型"变成一个有研究价值的问题

05 适合人群

✓ 研究生、博士、博士后、青年教师与科研人员

✓ 医院医生、科研骨干与临床研究团队

✓ 手上已有数据,但不知道下一步该怎么分析的人

✓ 统计和机器学习概念学过一些,但实际项目不会完整落地的人

✓ 会用大模型,却担心 AI 分析结果不可靠的人

✓ 需要做论文图表、预测模型、时间序列或图像分析的人

✓ 数据不能上传云端,需要本地 / 内网方案的团队

✓ 正在做系统综述与 meta 分析,希望显著减少机械工作量的人

完全没有编程也可以参加。课前先安排 Python 基础、NumPy、Matplotlib 三章预习,从环境安装、变量、循环、函数一直讲到数组计算和基础绘图。正式三天课程不要求现场大量手写 Python;真正需要掌握的是怎么说清任务、怎么看结果、怎么判断是否可信。

讲师覃秉丰·主讲人
Q

AI 科研培训领域顶级实战专家

阿里国际人工智能 AIGC 高级专家及培训讲师

300+

场线下培训

20,000+

科研人员学员

近 200

场大模型课程

行业深耕:2015 年起从事人工智能深度学习开发,先后为上海通用汽车、上海气象局等机构完成图像识别、NLP、语音、智能搜索等 AI 项目。

学术著作:2021 年出版 AI 专著《深度学习从 0 到 1》。

培训规模:2017 年至今累计完成 300+ 场线下深度培训,学员覆盖全国上百所高校、医院与科研院所。

大模型先驱:2023 年 5 月率先推出国内首批《大模型科研应用》系统课程,累计培训科研人员超过 10,000 人。

COURSE INFO

05时间、费用与报名

2026 COURSE DATES

北京场9 月 11 日—13 日

杭州场10 月 16 日—18 日

两期均为连续三天实战培训,采用线下授课 + 线上同步直播,可选择到场或线上参训,均提供完整课程回放。

收费三类报名方案与证书

A 类 · 3,980 元/人

包含中科启研结业证书,由中科启研科学技术发展中心颁发。

B 类 · 4,980 元/人

包含 A 类证书,以及《AI 智能体应用工程师》高级职业技能证书,由中国通信工业协会颁发。

C 类 · 6,800 元/人

包含 A、B 类证书,以及《AI 智能体应用工程师》高级职业技术证书,由工信部直属正局级单位颁发,为三类方案中的最高规格。

培训费用由北京中科启研科技有限公司、华科智研(北京)科技有限公司负责收取并提供发票,发票可涵盖培训费、会议费、咨询服务费、技术服务费、数据处理费等。

优惠报名优惠与学员福利
▌ 早鸟优惠:开课前 15 天报名,立减 300 元。
▌ 学生优惠:全日制在读学生凭学生证立减 300 元。
▌ 团报优惠:2 人以上每人减 200 元 | 3 人以上每人减 300 元 | 4 人以上每人减 400 元。
▌ 加赠名额:5 人以上团报,另赠送一个参训名额。

⚠ 早鸟、学生和团报优惠不可叠加,只能选择其中一种。

福利报名学员同时获得
✓ 一年内免费复训相同课程
✓ 一年内免费参加每月 AI + 科研前沿直播
✓ 永久答疑支持
✓ 完整高清视频回放

这不是一门教您记住更多算法的课,而是一门让您以后面对一份新数据时,知道该怎么做、怎么判断 AI 有没有做错、怎么把结果变成可复核科研成果的课。

08 CONTACT
联系西西老师咨询报名

📱手机:17602178996

✉️邮箱:si@zhongkeqiyan.com

💬微信:扫码咨询课程与报名优惠

扫码添加报名 / 咨询微信

AI x RESEARCH

相关学习资料