ARTICLE · 1081927
毫米级的小花,AI 一眼看穿:这只 "火眼金睛" 要给温室辣椒当花农
点击蓝字
关注我们
关注并星标
从此不迷路


公众号ID|计算机视觉研究院
学习群|扫码在主页获取加入方式
https://pmc.ncbi.nlm.nih.gov/articles/PMC13190429/pdf/fpls-17-1824412.pdf
计算机视觉研究院专栏
Column of Computer Vision Institute

PART/1
背景
为什么数一朵辣椒花,比数苹果花难得多?
苹果、桃花、梨花这些 "大花",花瓣舒展、颜色对比强,检测技术已经相当成熟。可辣椒花不一样,它同时踩中了视觉检测的三大雷区:
- 小(Tiny)
:初始花蕾直径仅 1–3 毫米,花瓣碎、纹理弱,和背景叶片相似度极高;
- 密(Dense)
:花朵成簇生长,相邻目标空间高度重叠;
- 挡(Occluded)
:叶片频繁遮挡,再叠加强光、阴影、动态光照。
更要命的是,过去主流的 YOLO 类算法都依赖 NMS(非极大值抑制)做后处理。花朵一密,挨得近的真目标就容易被 NMS 当成 "重复框" 误杀,导致系统性地把花数少了。
要破局,就需要一种:能看懂全局上下文、能跨尺度融合特征、而且不需要 NMS 也能分配好目标的架构。这,正是 RT-DETR 这类端到端 Transformer 检测器的强项。
PART/2
方法
CF-DETR 三招破局:给 Transformer 装上 "微距眼"
研究团队以 RT-DETR-r18 为底座,从骨干网络、上采样、特征融合三个维度动了手术刀。

【改进后 CF-DETR 模型网络结构图,含 Backbone、Neck(BiFPN + DySample)与检测头】
第一招:FasterNet 骨干 —— 只 "精读" 关键通道
原 RT-DETR 的标准卷积对所有输入通道一视同仁地做运算,但深层特征图里相邻通道大量冗余信息,反而把小花的边缘纹理 "稀释" 在背景噪声里。
FasterNet 引入部分卷积(PConv):只选 1/4 的代表性通道去做空间卷积,其余通道原样保留。理论计算下来,计算量(FLOPs)和内存访问量都降到了标准卷积的 1/16。这不是单纯的 "瘦身",而是让网络把注意力集中在真正含细节的通道上,对小花花蕾的边缘纹理更敏感。

【FasterNet 骨干网络结构图,含 Embedding、Merging 与 FasterNet Block 连接】
第二招:DySample 动态上采样 —— 不 "像素复制",改 "主动找采样点"
传统最近邻插值放大特征图,只是机械地复制邻近像素,花瓣边缘、雄蕊纹理这些高频细节一放大就糊掉、还会产生锯齿。
DySample 抛弃了昂贵的卷积核,改用基于可学习偏移的点采样机制:网络自己学出 "该在哪个位置采样",并引入静态 / 动态范围因子防止采样点重叠。对纹理极弱的初生花蕾,它能把特征点精准落在目标上,而不是背景噪声上。

【DySample 上采样模块结构图,含采样点生成与像素重组】
第三招:BiMAFPN 双向多尺度注意力 —— 深语义与浅细节双向对话
辣椒花从米粒大的绿蕾到 10 毫米的白花,尺度跨度极大。传统单路径特征金字塔很难兼顾 "深层语义" 和 "浅层细节"。
研究者设计了 BiMAFPN:在 BiFPN 双向跨层连接基础上,加入多分支辅助浅层分支(BiSAF),把骨干网保留下来的花瓣轮廓、雄蕊纹理等高分辨率细节直接 "注入" 融合路径;再通过可学习权重,让网络自动判断哪一层特征对认花更重要,压制土壤、叶片、光斑等无关背景。

【BiMAFPN 特征融合模块结构图,对比 (a) 传统 PANet 与 (b) 所提 BiMAFPN】
三招协同,再加上 RT-DETR 天生 NMS-free 的解码特性,密集花簇里 "该留哪个框" 的矛盾被从根上化解。
PART/3
实验
实战成绩单:精度、速度、边缘部署三不误
研究团队在湖南农业大学蔬菜研究基地,用佳能 R50/R50 相机于 2025 年 6–8 月花期采集,挑选 "8214upup" 上花型辣椒作为材料。原始高质量图像 1875 张,经旋转、亮度、高斯噪声、平移、遮挡模拟等混合增强后扩到 7274 张,按 8:1:1 划分为训练 / 验证 / 测试集。

【辣椒花期数据集增强处理示意图,含随机旋转、对比度、亮度、高斯噪声、平移与遮挡模拟】

【各随机数据增强方法的详细参数范围与样本分布】
1)消融实验:三模块缺一不可
以 RT-DETR-r18 为基线,逐步加入 FasterNet(A)、DySample(B)、BiMAFPN(C):

【CF-DETR 消融实验结果表(A/B/C 三模块组合下的 P、R、mAP50、mAP50-95、FLOPs、Params、FPS)】
单独上 A:FLOPs 从 56.9G 砍到 49.5G,精度升到 94.4%,但召回略降;
单独上 B 或 C:因前端特征没跟上,指标反而波动;
- A+B+C 全上
:召回补回到 78.7%,mAP50、mAP50-95 双双冲到 83.5% / 64.5%,GPU 上仍有 56.3 FPS。
这说明好成绩不是模块堆砌出来的,而是 "高效特征提取 A + 高保真空间传递 B + 自适应语义融合 C" 三者深度耦合的结果。
2)横向 pk:赢过 YOLO 全家桶和 Faster R-CNN

【不同检测算法训练结果对比表(含 Faster R-CNN、DEIM、RTDETR-r18/r34/r50、YOLOv8n/v13n/v26n 与 CF-DETR)】
- Faster R-CNN
这类两阶段检测器在小目标上完全失灵:精度仅 38% 左右,mAP50 只有 57–58%;
- YOLO 系列
速度快(最高 134.8 FPS),但召回卡在 74–76%,密集场景漏检多;
- CF-DETR
以 94.1% 精度、82.4% 召回、83.5% mAP50、64.5% mAP50-95 全面领先,把基线 RT-DETR-r18 的 mAP50 拉高了 2.1 个百分点,同时把计算量控制在 62.0G / 20.1M 参数。
在强光、阴影、模糊、遮挡这些 "魔鬼测试" 里,热力图(Grad-CAM)看得更明白:基线模型的注意力乱飘到背景杂草上,而 CF-DETR 的热力区像 "贴" 在花蕊和花瓣核心上,做到了 "目标热、背景冷"。

【不同模型在模糊、强光、阴影等环境干扰下的视觉检测结果对比】

【不同遮挡条件下(简单遮挡、强光遮挡、阴影填充)各模型视觉检测性能对比】

【基于 Grad-CAM 的各模型在强光、阴影、模糊、遮挡场景下注意力热力图对比】
对花(CF)和花蕾(CB)两类,模型分类准确率分别达到 85% 和 81%;少量误检主要来自叶片镜面反光 —— 亮斑太像白色花瓣。

【辣椒花期分类归一化混淆矩阵(CF 花、CB 花蕾、背景三类)】
3)搬上边缘设备:温室机器人真能用
算法再漂亮,跑在工作站上也不算数。团队把模型通过 TensorRT 加速,直接部署到 NVIDIA Jetson AGX Orin 嵌入式平台:

【NVIDIA Jetson AGX Orin 边缘计算平台部署实验与实时运行 FPS 截图】
在不损失精度的前提下,实测达到 30.65 FPS,单帧延迟约 33 毫秒,跨过了实时视频 30 FPS 的门槛。这意味着它可以脱离笨重的外接算力,直接挂在授粉机器人或温室巡检小车上工作。
PART/4
总结与展望
从算法到大棚:这只 "眼睛" 究竟能干嘛?
花期监测不是为了 "看个热闹"。在工业辣椒体系里,它串起了一整条决策链:
- 智能授粉管理
:机器实时知道哪朵花进入了最佳授粉期(花冠半开到全开、雄蕊散粉、柱头可授),精准指挥授粉机器人作业;
- 早期产量预测
:不用等果实成熟,靠高 - throughput 的花量统计就能提前估算坐果率与产量,调度下游加工产能;
- 数据驱动生产
:花的空间分布、长势强弱,变成温室水肥、温控、授粉策略的数字依据。
当然,研究也坦诚地留了边界:当遮挡率超过约 80%、花蕾只剩一小角,或低光照下花蕾与背景对比太弱时,仍会漏检;叶片镜面反光也会偶尔骗到 RGB 相机。下一步,团队计划引入 RGB - 深度 / 多光谱融合和连续帧时序建模,把这只眼睛练得更皮实。

【误检与漏检案例分析,(a) 误检示例、(b) 漏检示例】
一朵辣椒花,不过指甲盖大小;可它背后,是从田间到餐桌、从色素到医药的整条工业供应链。CF-DETR 这件工作的价值,不在于又刷了一个检测榜单,而在于证明了:为农业场景 "量身定做" 的 Transformer,能在边缘设备上同时兼顾精度与速度,把 "看清花" 这件小事,做成了智能温室里真正能跑起来的一环。
当 AI 开始愿意蹲在大棚里,一朵一朵地数那些 3 毫米的花蕾 ——precision horticulture(精准园艺),就离我们又近了一步。


END


转载请联系本公众号获得授权

计算机视觉研究院学习群等你加入!
ABOUT
计算机视觉研究院
🔗
YOLO-TLA:一种基于 YOLOv5 的高效轻量级小目标检测模型 ViT-YOLO:基于Transformer的用于目标检测的YOLO算法 SSMA-YOLO:一种轻量级的 YOLO 模型,具备增强的特征提取与融合能力,适用于无人机航拍的船舶图像检测 LUD-YOLO:一种用于无人机的新型轻量级目标检测网络 Gold-YOLO:基于聚合与分配机制的高效目标检测器 Drone-YOLO:一种有效的无人机图像目标检测 「无人机+AI」“空中城管” 无人机+AI:光伏巡检自动化解决方案 无人机视角下多类别船舶检测及数量统计 机场项目:解决飞行物空间大小/纵横比、速度、遮挡等问题引起的实时目标检测问题 2PCNet:昼夜无监督域自适应目标检测(附原代码) YOLO-S:小目标检测的轻量级、精确的类YOLO网络 大改Yolo框架 | 能源消耗极低的目标检测新框架(附论文下载) 改进的检测算法:用于高分辨率光学遥感图像目标检测