ARTICLE · 1150178
AI看婴儿动作,为什么先学“正常”?
全文约1600字 · 阅读约7分钟
10月8日,浙江大学团队在《npj Digital Medicine》报告了一个名为DeepAD的婴儿运动筛查模型。它把视频里的手脚动作转成关节轨迹,找出需要医生进一步查看的异常片段。研究使用了中国三家儿童医院在2019—2024年收集的1310段运动记录,其中涉及50名后来确诊脑瘫的婴儿。
这项研究要解决的困难很具体:异常病例少,专家标注又慢,怎样让AI从大量动作记录中学到有用的规律?团队选择了生成式学习——练习重建动作、预测后续变化,再把难以解释的片段交给医生。

浙江大学团队的研究发表于《npj Digital Medicine》,讨论如何从婴儿运动视频中识别需要进一步检查的信号。
把整段视频变成医生能查看的线索
临床上,一般运动评估会观察婴儿自发动作的质量和复杂程度。判断依据不只是手脚动得多不多,还包括不同部位如何配合、动作是否丰富。这要求经验,也需要后续发育情况来检验最初的判断。
DeepAD先用姿态估计工具提取身体关键点,再计算关节位置和角速度等特征。模型处理的是这些随时间变化的轨迹,而不是直接根据婴儿的脸或整个画面分类。骨架数据减少了可识别的面部信息,也让医生能回到具体关节和具体时刻查看线索。
系统会先标出异常时间点,再汇总为异常片段和整段视频的风险判断。它的输出是一条进一步检查的线索。研究中的脑瘫标签结合了风险病史、一般运动评估、影像和神经学检查,并随访至约一岁;视频预测不能替代这条诊断路径。

视频先转为关节轨迹,再进入异常分析;风险提示之后仍接着临床检查。图源:Ma等,图1。
学会重建动作,才能发现偏离
如果直接训练“脑瘫或非脑瘫”分类器,数量很少的阳性病例会成为瓶颈。DeepAD改用异常检测:让模型学习动作序列内部的联系,练习把输入重建出来,并利用前面的动作预测后续变化。
其基本假设是,常见动作模式更容易被模型解释;少见、异常的动作更难重建。团队又加入“信息增益”,衡量前一段动作的表示能为下一段提供多少信息。重建误差、时间关联和这部分信息共同组成异常分数。
这里的“生成”指重建和预测运动信号,训练材料仍是真实记录。表征训练不需要逐段动作标签,选择脑瘫筛查的参数和阈值仍要用标签。论文方法明确区分了无标签训练、验证集选择和任务相关调参,不能把它写成全流程不需要医生判断。
看下面的轨迹,正常婴儿也可能有明显的突然变化。因此,异常检测要结合动作的整体复杂程度和时间关系,单独看到一个尖峰并不足以下判断。

上排为正常动作,下排为脑瘫病例动作。不同颜色对应肘、腕和踝的坐标;正常动作也会出现突变,不能只数“尖峰”。图源:Ma等,图3。
94%的AUC,仍留下漏检
研究按婴儿划分训练集和测试集,让同一个婴儿的记录留在同一侧。总体实验中,作者报告最佳版本的AUC约为0.94、召回率约75%、精确率约96%。AUC描述不同阈值下的区分能力;召回率则说明,在报告的判断条件下,仍有约四分之一的阳性没有被检出。
另一个实验随机选取20名脑瘫婴儿和20名非脑瘫婴儿,请三位专家仅观看记录,不提供额外临床资料。在这个小样本对照中,模型的平均召回率为88%,专家为80%,两者平均精确率均为95%。这些条件足以改变数字的含义:它比较的是特定视频阅读任务,不能推成AI全面超过医生。

右上和下排显示模型比较,左下为40名婴儿的专家对照。两组实验的召回率不同,不能把小样本对照的88%当作全队列结果。图源:Ma等,图2。
换家医院之后,还要检查哪一层
团队还比较了不同医院、不同记录设备之间的迁移。它回答的是模型换到另一套临床记录时,是否仍能保留区分能力。研究中的视频使用Kinect和RealSense设备,拍摄时要求婴儿安静、清醒、关键部位可见,哭闹时暂停。家庭里的角度、遮挡和状态变化尚需单独检验。

下排比较不同医院之间的迁移表现;H1→H2表示在医院1训练、到医院2测试。跨院结果显示迁移的可能性,仍不等于家庭拍摄场景的验证。图源:Ma等,图4。
姿态估计也是一个上游限制:所用工具主要基于成人动作训练,婴儿躺卧时的关键点可能提取不准。后面的模型即使能很好地分析轨迹,也会继承前面这一步的错误。50名脑瘫病例还不足以验证少见动作模式或各个脑瘫亚型;研究也没有证明筛查能改善儿童长期结局。
对研究者,开放条件同样具体:骨架数据需邮件申请,仅限科研用途;论文提供Code Ocean项目用于复现,公开测试也需申请账号。它还不是一个可以把任意家庭视频上传、直接获得诊断的服务。当前可以拿来检验的,是模型能否将长视频里的可疑动作定位得更清楚,让医生有据可查地决定下一步检查。
资料与图源
Ma N. 等,Infant neurodevelopmental impairment detection via large-scale motion screening with generative learning,2026。论文与完整方法 · 复现项目。
本文所引论文图:©作者2026,CC BY-NC-ND 4.0,用于非商业研究介绍,图像内容未改编。