夜雨聆风学习资料网

ARTICLE · 1081927

毫米级的小花,AI 一眼看穿:这只 "火眼金睛" 要给温室辣椒当花农

毫米级的小花,AI 一眼看穿:这只 "火眼金睛" 要给温室辣椒当花农

点击蓝字

关注我们

关注并星标

从此不迷路

计算机视觉研究院

公众号ID|计算机视觉研究院

学习群|扫码在主页获取加入方式

https://pmc.ncbi.nlm.nih.gov/articles/PMC13190429/pdf/fpls-17-1824412.pdf

计算机视觉研究院专栏

Column of Computer Vision Institute

本文提出CF-DETR,一个专为 "小、密、挡" 的辣椒花量身定制的 Transformer 检测框架。它在自建温室数据集上把精度推到 94.1%,还能在一块边缘芯片上跑出 30.65 FPS 的实时速度。

PART/1

背景   

为什么数一朵辣椒花,比数苹果花难得多?

苹果、桃花、梨花这些 "大花",花瓣舒展、颜色对比强,检测技术已经相当成熟。可辣椒花不一样,它同时踩中了视觉检测的三大雷区:

  • 小(Tiny)
    :初始花蕾直径仅 1–3 毫米,花瓣碎、纹理弱,和背景叶片相似度极高;
  • 密(Dense)
    :花朵成簇生长,相邻目标空间高度重叠;
  • 挡(Occluded)
    :叶片频繁遮挡,再叠加强光、阴影、动态光照。

更要命的是,过去主流的 YOLO 类算法都依赖 NMS(非极大值抑制)做后处理。花朵一密,挨得近的真目标就容易被 NMS 当成 "重复框" 误杀,导致系统性地把花数少了。

要破局,就需要一种:能看懂全局上下文、能跨尺度融合特征、而且不需要 NMS 也能分配好目标的架构。这,正是 RT-DETR 这类端到端 Transformer 检测器的强项。

PART/2

方法   

CF-DETR 三招破局:给 Transformer 装上 "微距眼"

研究团队以 RT-DETR-r18 为底座,从骨干网络、上采样、特征融合三个维度动了手术刀。

【改进后 CF-DETR 模型网络结构图,含 Backbone、Neck(BiFPN + DySample)与检测头】

第一招:FasterNet 骨干 —— 只 "精读" 关键通道

原 RT-DETR 的标准卷积对所有输入通道一视同仁地做运算,但深层特征图里相邻通道大量冗余信息,反而把小花的边缘纹理 "稀释" 在背景噪声里。

FasterNet 引入部分卷积(PConv):只选 1/4 的代表性通道去做空间卷积,其余通道原样保留。理论计算下来,计算量(FLOPs)和内存访问量都降到了标准卷积的 1/16。这不是单纯的 "瘦身",而是让网络把注意力集中在真正含细节的通道上,对小花花蕾的边缘纹理更敏感。

【FasterNet 骨干网络结构图,含 Embedding、Merging 与 FasterNet Block 连接】

第二招:DySample 动态上采样 —— 不 "像素复制",改 "主动找采样点"

传统最近邻插值放大特征图,只是机械地复制邻近像素,花瓣边缘、雄蕊纹理这些高频细节一放大就糊掉、还会产生锯齿。

DySample 抛弃了昂贵的卷积核,改用基于可学习偏移的点采样机制:网络自己学出 "该在哪个位置采样",并引入静态 / 动态范围因子防止采样点重叠。对纹理极弱的初生花蕾,它能把特征点精准落在目标上,而不是背景噪声上。

【DySample 上采样模块结构图,含采样点生成与像素重组】

第三招:BiMAFPN 双向多尺度注意力 —— 深语义与浅细节双向对话

辣椒花从米粒大的绿蕾到 10 毫米的白花,尺度跨度极大。传统单路径特征金字塔很难兼顾 "深层语义" 和 "浅层细节"。

研究者设计了 BiMAFPN:在 BiFPN 双向跨层连接基础上,加入多分支辅助浅层分支(BiSAF),把骨干网保留下来的花瓣轮廓、雄蕊纹理等高分辨率细节直接 "注入" 融合路径;再通过可学习权重,让网络自动判断哪一层特征对认花更重要,压制土壤、叶片、光斑等无关背景。

【BiMAFPN 特征融合模块结构图,对比 (a) 传统 PANet 与 (b) 所提 BiMAFPN】

三招协同,再加上 RT-DETR 天生 NMS-free 的解码特性,密集花簇里 "该留哪个框" 的矛盾被从根上化解。

PART/3

实验   

实战成绩单:精度、速度、边缘部署三不误

研究团队在湖南农业大学蔬菜研究基地,用佳能 R50/R50 相机于 2025 年 6–8 月花期采集,挑选 "8214upup" 上花型辣椒作为材料。原始高质量图像 1875 张,经旋转、亮度、高斯噪声、平移、遮挡模拟等混合增强后扩到 7274 张,按 8:1:1 划分为训练 / 验证 / 测试集。

【辣椒花期数据集增强处理示意图,含随机旋转、对比度、亮度、高斯噪声、平移与遮挡模拟】

【各随机数据增强方法的详细参数范围与样本分布】

1)消融实验:三模块缺一不可

以 RT-DETR-r18 为基线,逐步加入 FasterNet(A)、DySample(B)、BiMAFPN(C):

【CF-DETR 消融实验结果表(A/B/C 三模块组合下的 P、R、mAP50、mAP50-95、FLOPs、Params、FPS)】

  • 单独上 A:FLOPs 从 56.9G 砍到 49.5G,精度升到 94.4%,但召回略降;
  • 单独上 B 或 C:因前端特征没跟上,指标反而波动;
  • A+B+C 全上
    :召回补回到 78.7%,mAP50、mAP50-95 双双冲到 83.5% / 64.5%,GPU 上仍有 56.3 FPS。

这说明好成绩不是模块堆砌出来的,而是 "高效特征提取 A + 高保真空间传递 B + 自适应语义融合 C" 三者深度耦合的结果。

2)横向 pk:赢过 YOLO 全家桶和 Faster R-CNN

【不同检测算法训练结果对比表(含 Faster R-CNN、DEIM、RTDETR-r18/r34/r50、YOLOv8n/v13n/v26n 与 CF-DETR)】

  • Faster R-CNN
     这类两阶段检测器在小目标上完全失灵:精度仅 38% 左右,mAP50 只有 57–58%;
  • YOLO 系列
    速度快(最高 134.8 FPS),但召回卡在 74–76%,密集场景漏检多;
  • CF-DETR
     以 94.1% 精度、82.4% 召回、83.5% mAP50、64.5% mAP50-95 全面领先,把基线 RT-DETR-r18 的 mAP50 拉高了 2.1 个百分点,同时把计算量控制在 62.0G / 20.1M 参数。

在强光、阴影、模糊、遮挡这些 "魔鬼测试" 里,热力图(Grad-CAM)看得更明白:基线模型的注意力乱飘到背景杂草上,而 CF-DETR 的热力区像 "贴" 在花蕊和花瓣核心上,做到了 "目标热、背景冷"。

【不同模型在模糊、强光、阴影等环境干扰下的视觉检测结果对比】

【不同遮挡条件下(简单遮挡、强光遮挡、阴影填充)各模型视觉检测性能对比】

【基于 Grad-CAM 的各模型在强光、阴影、模糊、遮挡场景下注意力热力图对比】

对花(CF)和花蕾(CB)两类,模型分类准确率分别达到 85% 和 81%;少量误检主要来自叶片镜面反光 —— 亮斑太像白色花瓣。

【辣椒花期分类归一化混淆矩阵(CF 花、CB 花蕾、背景三类)】

3)搬上边缘设备:温室机器人真能用

算法再漂亮,跑在工作站上也不算数。团队把模型通过 TensorRT 加速,直接部署到 NVIDIA Jetson AGX Orin 嵌入式平台:

【NVIDIA Jetson AGX Orin 边缘计算平台部署实验与实时运行 FPS 截图】

在不损失精度的前提下,实测达到 30.65 FPS,单帧延迟约 33 毫秒,跨过了实时视频 30 FPS 的门槛。这意味着它可以脱离笨重的外接算力,直接挂在授粉机器人或温室巡检小车上工作。

PART/4

总结与展望   

从算法到大棚:这只 "眼睛" 究竟能干嘛?

花期监测不是为了 "看个热闹"。在工业辣椒体系里,它串起了一整条决策链:

  • 智能授粉管理
    :机器实时知道哪朵花进入了最佳授粉期(花冠半开到全开、雄蕊散粉、柱头可授),精准指挥授粉机器人作业;
  • 早期产量预测
    :不用等果实成熟,靠高 - throughput 的花量统计就能提前估算坐果率与产量,调度下游加工产能;
  • 数据驱动生产
    :花的空间分布、长势强弱,变成温室水肥、温控、授粉策略的数字依据。

当然,研究也坦诚地留了边界:当遮挡率超过约 80%、花蕾只剩一小角,或低光照下花蕾与背景对比太弱时,仍会漏检;叶片镜面反光也会偶尔骗到 RGB 相机。下一步,团队计划引入 RGB - 深度 / 多光谱融合和连续帧时序建模,把这只眼睛练得更皮实。

【误检与漏检案例分析,(a) 误检示例、(b) 漏检示例】

一朵辣椒花,不过指甲盖大小;可它背后,是从田间到餐桌、从色素到医药的整条工业供应链。CF-DETR 这件工作的价值,不在于又刷了一个检测榜单,而在于证明了:为农业场景 "量身定做" 的 Transformer,能在边缘设备上同时兼顾精度与速度,把 "看清花" 这件小事,做成了智能温室里真正能跑起来的一环。

当 AI 开始愿意蹲在大棚里,一朵一朵地数那些 3 毫米的花蕾 ——precision horticulture(精准园艺),就离我们又近了一步。

有相关需求的你可以联系我们!

END

转载请联系本公众号获得授权

计算机视觉研究院学习群等你加入!

ABOUT

计算机视觉研究院

计算机视觉研究院主要涉及深度学习领域,主要致力于目标检测、目标跟踪、图像分割、OCR、模型量化、模型部署等研究方向。研究院每日分享最新的论文算法新框架,提供论文一键下载,并分享实战项目。研究院主要着重”技术研究“和“实践落地”。研究院会针对不同领域分享实践过程,让大家真正体会摆脱理论的真实场景,培养爱动手编程爱动脑思考的习惯!
往期推荐 

🔗

相关学习资料