ARTICLE · 1055889
通知|“AI 赋能生物医学数据分析—从工具使用到论文实践”高级研修班10月末开班
▲ 封面|生物医学数据驱动科研与未来
如果把现代生物医学研究拆开来看,真正驱动范式变革的,往往不是某一台昂贵的仪器,而是贯穿全程的“数据”。从研究假设的生成、实验的设计与执行,到结果的统计分析与可视化呈现,再到论文的撰写与复现——数据,是这条创新链条上最底层的变量。 在论文发表层面,数据的价值尤为直接:一份高质量、可追溯、可复现的数据集,本身就是一篇好文章的骨架。当影像、组学、临床等多模态数据被规范地整合与挖掘,研究者得以产出更具说服力的证据链,这正是《Nature Medicine》等顶刊愈发青睐的研究范式;而数据治理能力,正日益成为决定科研产出效率与学术竞争力的隐形门槛。 面向未来研究,数据的意义更进一步:AI-Ready 数据集、检索增强(RAG)知识库、能够自主调用工具完成分析的大模型 Agent,正在把科研人员从重复劳动中解放出来。谁先掌握“数据全栈”能力,谁就更可能从“做实验的人”,升级为“定义问题、驾驭智能”的主导者。 正是在这样的背景下,中国科学院人才交流开发中心组织了本次高级研修班。它围绕“数据获取—质控—分析—建模—论文复现”的全闭环能力主线展开,下面先将这份通知的全文奉上。
▲ 图1 生物医学数据的未来价值思维导图:精准诊断 / 个体化治疗 / 医学信息化 / 药物研发 / 公共卫生 / 科研创新
▲ 中国科学院人才交流开发中心官网发布截图
各有关单位: 国家全面部署实施“人工智能+”行动,相继出台人工智能赋能医疗卫生、药品创新研发等系列指导文件,明确提出推动AI深度融入生命科学基础研究、新药研发与临床转化,培育生物医药领域跨学科创新人才,加快重塑我国生物医学科研创新范式,为生物医药产业高质量发展赋予全新动能。数据已然成为生物医学创新的核心生产要素,为加快推进人工智能真正融入日常课题研究,助力科研工作提质增效,培养一批兼具生物医学专业功底、数据全栈处理能力与人工智能应用素养的BT+IT复合型科研人才,我中心将于2026年10月举办“人工智能赋能生物医学数据分析—从工具使用到论文实践”高级研修班,特邀中国科学院相关研究所科研数据资深专家传授科研数据全栈覆盖的实操技能。现将具体事宜通知如下:
文本数据:电子病历EMR、PubMed文献库介绍;医学实体标准化方法;MIMIC、CMCR公开病例数据库访问;文献批量爬取。 图像数据:医学影像DICOM、数字病理WSI(TIFF/SVS)格式;PyDicom、OpenSlide进行图像读取和转换。 组学数据:基因组学、转录组学及单细胞测序数据的数据结构(fastq、bam、表达矩阵),Seurat、Scanpy进行数据读取。
数据清洗与脱敏:熟悉脱敏规则,利用正则表达式与自然语言处理工具进行脱敏和提取。 缺失值与异常值处理:识别缺失与异常值,使用pandas等工具完成多重插补、KNN插补及MICE插补;结合PyOD等算法识别并处理异常样本。 医学图像的去噪、旋转、扩增:基于OpenCV、MONAI等Python工具,完成医学图像去噪、配准、重采样、强度标准化,以及旋转、翻转、裁剪和弹性形变等空间增强。 批次效应(Batch Effect)校正:通过PCA、UMAP、t-SNE等降维方法识别组学数据中的多中心系统性偏差,使用ComBat、Harmony、Scanpy等工具实施批次效应校正。
有标注与无标注数据:预训练和微调分层数据构建,图像文本的常用标注方法。 大语言模型指令微调数据构造:结构化构建{Instruction-Input-Output}格式的问答数据。学习思维链CoT和不同标注的加入方法。 检索增强数据库构建:RAG原理,LIamaIndex完成文本分块、向量嵌入Embedding与索引构建,学习BM25与向量混合检索、重排序方法。 数据集划分与验证:训练集与测试集的划分,采用分层五折交叉验证(5-fold Cross Validation)评估模型泛化能力。
描述性统计与假设检验:连续/分类变量的统计描述规范,T检验、Fisher精确检验、方差分析(ANOVA)、秩和检验与卡方检验的适用场景与P值解读。 高维数据的降维流形分析:主成分分析(PCA)、t-SNE与UMAP探索患者亚群发现或细胞分群。 生物信息专有统计分析:差异表达分析(DESeq2/edgeR)的原理,LEfSe亚群分析、α/β多样性分析和PCoA分析,GSEA,LASSO,加权基因共表达网络分析(WGCNA)以及下游的GO功能注释与KEGG通路富集分析,生物网络RandomWalk算法。 生存分析:生存时间与删失数据的定义,Kaplan-Meier生存曲线绘制及Log-rank检验,Cox比例风险回归模型。
基础科研图表:Graphpad绘制散点图、箱线图、小提琴图、柱状图、相关性图、热力图。 组学可视化:火山图(Volcano Plot)展示差异基因,聚类热图(Heatmap)展示表达模式。 网络拓扑分析:PPI互作网络分析、Cytoscape基因调控网络可视化。 医学图像模型可视化:模型决策区域的特征热力图(如Grad-CAM)生成,增强结果的临床解释性。
经典机器学习算法:熟悉Sklearn包,使用逻辑回归、支持向量机(SVM)、随机森林与XGBoost分类方法。 深度学习算法:Pytorch环境部署,CNN/ViT在医学图像中的特征捕获,Transformer等序列模型。 多模态晚期融合:对比早/中期融合,深入解析在模型决策层利用各自模态输出的概率向量进行加权融合的晚期融合优势。 模型评估指标:全面评估体系构建(ROC/AUC、PR曲线、F1-score),利用SHAP值解析各模态特征对最终预测的贡献度。
文献解读和综述撰写:利用工具快速抽取海量医学文献中的研究动机、核心机制与关键发现。对多篇文献生成逻辑严密、脉络清晰的文献综述。 工具调用和数据分析:设计Agent自主调度流程,使其能够编写代码、执行计算并调用外部生物信息学分析工具。 常用AI4S工具:常见的文献和数据分析AI for Science平台,包括DrAI、VIPaper、语鲸、玻尔、秘塔。 AI辅助编程:利用Codex、DeepSeekHarness等工具框架,通过自然语言对话快速完成数据处理的编程与调试。
全国各级医疗机构、科研院所、高等院校、生物医药企业、科技服务公司等从事临床医学、基础医学、公共卫生、生物统计、生物信息学、药学、护理学相关领域的科研负责人、课题骨干、医护技术人员、实验研发工程师、数据分析专员;高校医学院、生物工程、大数据相关专业教师及科研学生;生物医药、医疗器械、医学检验、基因测序企业的研发与数据分析岗位人员,以及所有需要系统掌握生物医学数据清洗、统计建模、生信分析、临床数据挖掘与科研论文数据处理的相关从业者与爱好者。
授课师资均为来自中国科学院研究所、知名院校的相关科研数据处理专家,拥有丰富的科研项目数据实践经验。
本次培训由中国科学院人才交流开发中心主办、北京中科创嘉人力资源咨询有限公司承办。
收款账户、联系方式及报名邮箱请见附件。
请扫描下方二维码咨询具体报名链接
▲ 咨询联络
▲ 附件:文件通知(共7页,末页含盖章) 中国科学院人才交流开发中心 2026年9月14日
相关研修班已经举办多次,广受相关单位好评。
同时附近期同类课程供参考
AI · 药物研发 · 技术前沿 长按 or 扫码关注 · 持续更新 #AI4S #OpenClaw #龙虾;#人工智能;#人工智能赋能科学研究;#药物研发; #生物发酵;#AI制药;#生物制造;#机器学习;#AI智药;#合成生物学;#强化学习; #AIDD;#生物制药;#研修班;#Codex
— 完 — |













