ARTICLE · 1127715
AI 数俯卧撑很简单,但揪出姿势问题才见真本事
AI 数俯卧撑很简单,揪出姿势问题才见本事
摄像头捕捉人体动作,能输出的信息远比很多人想象的丰富。
不只是简单统计完成次数。近年多篇公开实测研究,已经让 AI 能回答更深一层问题:这个动作哪里不到位?腰部塌了多少、两侧发力差距多大、做到第几次动作开始变形。
计数这件事,如今基本是角度计算后的附带结果:天津职业技术师范大学的这套系统设定相似度阈值为 60,当单帧姿态和标准动作相似度达标,就计数一次,俯卧撑实时计数平均准确率可达 98.33%。计数早已不是技术瓶颈,后续的质量评估才是难点。
先说核心结论
拆解人体关节点
轻量模型单帧处理速度是 OpenPose 的 13.3 倍,整套评估耗时 0.29 秒(《Scientific Reports》2025)
识别动作类型
1882 段视频错 6 段,准确率 99.68%,采用留一学校交叉验证(《Applied Sciences》2026)
评判动作规范度
标准姿势角度平均绝对误差 2.68–2.86 度(IEEE ICCIT 2025)
联动生理状态
融合动作质量分、心率、血氧,实时调整每组训练次数与间歇时长(MLNN'26 2026)
第一步:把人体拆解成关节点
机器分析动作,不是先识别是什么动作,而是先拆解人体。它不识别面部,而是提取肩、肘、腕、髋、膝、踝等关键点,转换成一组坐标;三个点相连形成夹角,以此算出关节角度。

在 AI 视角里,人体由十几个到几十个带坐标的关节点构成,先提取点位,才能计算角度。

行业内常用两套关键点体系:17 点模型,足够计算四肢与躯干角度;33 点模型额外包含手指、脚跟与脚尖,面部点位也更细,可以输出立体空间位置。点位越多,细节测算越精细,但计算开销也会随之增大。

这套方案的速度表现很突出:天津职业技术师范大学的系统基于 BlazePose,单帧处理速度达到 OpenPose 的 13.3 倍,搭配优化后的对齐算法,从提取关键点、姿态比对到输出评估结果全程仅 0.29 秒,足以实现训练时实时反馈。
但高效是有代价的。BlazePose 关节点定位命中率(PCK)为 0.72,低于 OpenPose 的 0.81。也就是说,轻量模型提取关键点的准确度本身就低一档,遇到复杂动作,评估结果会打折扣。
第二步:识别是什么动作
秘鲁圣玛丽亚天主教大学今年 9 月发表在《Applied Sciences》的研究,选取四项标准化体测动作:仰卧起坐、二头弯举、坐位体前屈、立定跳远。原始数据集共 2034 段视频,经过校验剔除 152 段来自同一学校的重复样本,最终保留 1882 段数据,使用 17 个关键点做姿态提取。
研究对比了两种数据输入方式:一种是人工预先计算好的 110 项特征数据,包含关节弯曲角度、运动速度、动作幅度等;另一种是直接输入 128 帧原始坐标序列,让模型自主学习特征。
验证标准也十分严苛:采用留一学校交叉验证,轮流将其中一所学校的数据作为测试集,其余学校数据用于模型训练,相当于在不同场地、摄像头、光线条件下反复测试。

得出的结论有些反直觉。110 项特征搭配随机森林(集成多棵决策树投票判定的经典算法),在 1882 段视频中仅识别错误 6 段,四类动作平均 F1 值 0.9964,准确率 99.68%。而三款深度学习模型表现均落后:BiLSTM 为 0.9711、CNN1D 为 0.9666、ST-GCN 为 0.9498。论文还测试了两种量子机器学习算法,性能同样不及这套经典方案。
可见,当动作固定、样本规模有限时,提前提炼清晰特征,远比一味堆砌深层模型更有效。
第三步:判断动作做得对不对
2025 年第 28 届 ICCIT 会议提出的系统,实现了这一环节。先用姿态模型提取关键点,再通过时序卷积网络识别动作 —— 这类网络按时间顺序读取整套动作,而非只看单帧画面;中间借助粒子滤波平滑画面里抖动的点位;最后依靠小型神经网络估算标准姿态对应的关节角度。这套系统动作识别准确率 97.63%,估算出的标准角度与真实角度的平均绝对误差(MAE)仅 2.68~2.86 度。两三度的差距,差不多就是 “手再抬高一点,动作就能到位” 的细微差别。
同一关节上,标准角度和实际角度之间相差的这几度,就是评判动作质量的核心依据。

不同动作关注的角度各有侧重。天津这套系统评估深蹲,重点观察膝关节角度偏差;负重训练中,关节角度微小偏移,既会影响动作表现,也会提升受伤风险。系统同时监测多项指标:肘关节过度弯曲会加重上肢关节负担,背部角度不足会造成脊柱不稳,髋关节角度偏差则反映下肢活动受限、动作无法完成。
过去这些细节只能靠教练肉眼判断,如今都可以转化成量化的角度数据。
更进一步:结合生理状态综合评估
今年 9 月 MLNN 26 的一篇军事体能训练相关论文,将动作质量拆解为三个维度:姿态规范性、节奏稳定性、动作完整度,合并生成质量评分;再结合心率、血氧饱和度、肌肉负荷数据,实时调整下一组训练次数、休息时长以及虚拟训练场景难度。姿态估计采用轻量网络,测试动作为俯卧撑、仰卧起坐、引体向上。研究还搭建可控虚拟环境,模拟高温、低氧、复杂地形等训练压力场景。

《解放军报》今年 7 月报道的火箭军某数字化训练场,已经在真实场地做到了同一层。仰卧卷腹考核结束,屏幕直接显示动作频次 128 次 / 分钟、心率峰值 156,并推送个性化训练建议;单杠完成一组引体向上后,系统通过三维可视化还原姿态,提示 “摆动幅度过大,肩胛未充分发力”;3000 米长跑途中持续监测配速与生命体征,心率异常自动预警,整套流程无需人工发令、计时、记录。
动作质量分叠加生理指标,解决的是另一个关键问题:这个人当前身体状态,还能不能继续训练。
总结
整体来看,AI 识别“是什么动作”的技术已经基本成熟;而精准判断“动作差在哪”,正从实验室数据走向真实场地。通过提取人体关节关键点,AI 能够计算关节角度,量化动作偏差。借助合适的特征搭配算法,动作识别可以达到很高准确率;轻量模型能实现快速反馈,满足训练时实时纠错的需求。这项技术还可以把动作质量评分和心率、血氧等生理指标结合,动态调整训练方案。目前已经在体能训练场落地,实现动作自动评判,省去人工记录、计时的环节。
参考
· Sulla Valdivia AL, et al. Comparative Evaluation of Classical, Deep, and Quantum Machine Learning for Video-Based Physical Activity Classification.Applied Sciences,2026,16(18):9344. doi:10.3390/app16189344.(2034 段视频去重后 1882 段,17 个 COCO 关键点,嵌套留一学校交叉验证,随机森林 Macro-F1 0.9964、准确率 0.9968)
· Guo T, Yin Q, Liu X, et al. Fitness exercise evaluation system based on improved DTW algorithm. Scientific Reports, 2025, 15:19961. doi:10.1038/s41598-025-02535-5.(BlazePose + KNN + S-WFDTW,识别与计数准确率 98.33%,单次处理 0.29 秒,处理速度 13.3 倍于 OpenPose,PCK 0.72 对 0.81)
· Ramim SI, Rahman MA, Sadik F, et al. Real-Time Posture Tracking and Visual Feedback for Improving Exercise Performance Using Deep Learning. IEEE ICCIT,2025,pp.1046–1051. doi:10.1109/ICCIT68739.2025.11490277.(姿态估计 + TCN + 粒子滤波,动作识别 97.63%,标准姿势估算 MAE 2.68–2.86 度)
· Xie H. Personalized Improvement of Military Physical Training via Deep-Learning-Based Pose Assessment and Adaptive Feedback. MLNN'26, 2026, pp.35–40. doi:10.1145/3821725.3821731.(动作质量分:姿态正确性、时序稳定性、完成度,融合心率、血氧、肌肉负荷)
· 《“智慧大脑”助力官兵强身健体》,解放军报 / 人民网,2026-07-10。(火箭军某部数字化训练场:动作频次、心率峰值、三维姿态还原与个性化建议)
部分素材来源于网络 如有侵权 请联系删除