云计算百科
云计算领域专业知识百科平台

yolo模型介绍

目录

一、Yolo介绍

二、Yolo和CNN

三、Yolo的原理

Yolo的原理

非极大值抑制(NMS)

损失函数

四、Yolo的发展史

五、总结


        上一篇内容 PDF解析工具-MinerU 中提到了yolo模型。YOLO(You Only Look Once)属于传统计算机视觉 CV (Computer Vision)模型,和 Qwen‑VL 这类多模态大模型能力有本质区别。YOLO 负责画框定位物体,没有高级语义推理;多模态大模型可以看懂画面、做逻辑推理。

一、Yolo介绍

        在各类实际业务场景里,目标检测任务占比最高;如下是真实使用场景中,对车画了一个框,并在上面的标签(label)上写了识别物体的种类。

目前目标检测分为两大技术路线:

  • 两阶段 Two‑Stage(R‑CNN 系列):先生成大量候选框,再对每个框做分类识别。精度更高,但速度慢,达不到实时。
  • 一阶段 One‑Stage(YOLO、SSD):整张图片只经过一次 CNN 卷积运算,同时预测物体位置和类别,端到端输出结果。最大优势就是速度快,可以视频实时检测。
  • Two-stage方法准确度高一些,但速度慢,one-stage算 法是速度快,但是准确性低一些

    YOLO 名字含义:You Only Look Once,图片只看一次就完成全部检测。

            YOLO的特点:速度快,能够达到实时的要求,泛化能力强。广泛应用于各种需要目标检测的场景:

             • 自动驾驶:检测道路上的车辆、行人、交通标志等,为自动驾驶系统提供决策依据。

            • 安防监控:在视频监控中实时检测可疑人物或物体,提高安防效率。

            • 机器人视觉:帮助机器人识别和定位周围的物体,实现自主导航和操作。

            • 智能交通:用于交通流量监测、违章检测等,提高交通管理的智能化水平。

    YOLO是一种非常有影响力的实时目标检测算法,以快速、高效的特点在很多领域都发挥了重要作用。当然在实际工程中,YOLO也并不一定能完全满足需求,需要和多模态大模型经常搭配使用,如:

  • MinerU 文档解析:YOLOv8 检测 PDF 中公式区域,再交给 UniMERNet 转 LaTeX;LayoutLMv3 做布局检测,请回看PDF解析工具-MinerU。
  • 监控业务:YOLO 实时框选出人员,再把画面送入多模态模型,统计行为、事件。
  • 二、Yolo和CNN

            CNN (卷积神经网络) 我们在前面介绍过:卷积神经网络(CNN) 是做特征提取的关键工具。比如我们想要区分人:

            • 先用S细胞(卷积)找到无数个小碎片(横线、竖线、圆弧)。

            • 再用C细胞(池化)忽略掉无关紧要的位置抖动。

            • 最后层层叠加,把线条拼成眼睛,把眼睛拼成脸,把脸拼成完整的人。

    那么通过CNN学习,背景部位的激活度基本很少。卷积层数越多,学习到的特征越高阶。

            YOLO (You Only Look Once) 是 解决方案/架构 。 它是一个设计精妙的算法框架。把这一堆CNN 按照特定的顺序组装起来,不仅要看懂图,还要算出物体在哪个位置(坐标)。如果把CNN 看作砖块,YOLO 是用砖块盖起来的摩天大楼。

    三、Yolo的原理

    Yolo的原理

    1)网格划分:把输入图片切分为 S×S 的网格(YOLO‑V1 是 7×7,共 49 个格子)。

    2)每个网格输出预测 每个网格预测 B 个边界框 BBox,每个框输出 5 个值:中心点 x、y,宽 w,高 h,置信度 confidence(0~1,表示预测框的可信程度);同时输出 C 个类别的概率。

            这个B是自己来设定的,假如设B等于2,一个格子里面最多可以包含两个物体,C是能识别的物体的种类。到底能识别多少种物体,需要提前对yolo模型进行训练。

            每个网格输出的向量长度为 len = B * 5 + C

            把所有网格拼在一起,最终输出张量形状:(S,S,len)

    3)卷积做特征提取

    非极大值抑制(NMS)

    非极大值抑制 NMS 同一个物体会被多个网格重复预测,生成大量重叠框。通过 IOU 交并比计算框重叠程度,保留置信度最高的框,过滤掉重复冗余框,得到最终干净的检测结果。

    具体流程如下:

    step 1:将重复预测框按照置信度排序,保留置信度最高的A框作为基准框

    step 2:将框A和其他框计算交并比,如果交并比大于某个阈值,那么说明重叠严重,去掉

    循环以上步骤,直到所有框处理完毕。

    损失函数

            yolo的速度快,是因为它只经过一次计算就预测了物体的类别和位置。他的误差有分类误差和定位误差。

    四、Yolo的发展史

  • YOLO‑V1 奠定一阶段检测整体框架;V2/V3 持续优化性能。YOLO 原作者完成 V1‑V3 之后,出于伦理顾虑退出 CV 社区,后续 V4、V5 及更高版本由社区继续迭代。
  • 优势:速度极快,早期版本就可以做到每秒 45 帧,轻量版本可达 155 帧,可在 CPU、浏览器端实时运行;开源、工业落地广泛,无人驾驶、安防监控、文档检测都大量使用。
  • YOLO 版本演进表:

    版本年份关键改进代表意义
    YOLOv1 2015 单阶段检测开山之作,S×S 网格划分 + 直接回归坐标与类别 速度革命:首次实现实时检测(45 FPS),将检测视为回归问题
    YOLOv2 2016 引入 Anchor Box、批归一化(BN)、多尺度训练(Multi-Scale)、高分辨率分类器 精度大幅提升:mAP 从 63.4% 提升至 78.6%,支持 9000+ 类别(YOLO9000)
    YOLOv3 2018 多尺度预测(13×13/26×26/52×52)、特征金字塔网络(FPN)、独立逻辑分类器 小目标检测增强:Darknet-53 backbone,兼顾速度与精度
    YOLOv4 2020 CSPDarknet53 骨干、Mosaic 数据增强、CIoU Loss、DropBlock 正则化、SPP+PAN Neck 工业落地标杆:系统验证 Bag of Freebies 与 Bag of Specials 技巧组合
    YOLOv5 2020 Ultralytics 工程化实现、PyTorch 原生、AutoAnchor、模型缩放(n/s/m/l/x)、ONNX 导出 工程化典范:易用性极佳,社区生态最活跃,部署友好
    YOLOv6 2022 美团开源、RepVGG 重参数化、更高效的 Neck 设计、硬件感知量化(QAT) 产业落地:专精工业场景,推理速度优化显著
    YOLOv7 2022 E-ELAN 架构、模型重参数化、动态标签分配、扩展的高效层聚合网络 学术 + 工程并重:训练成本降低,实时性与精度双优
    YOLOv8 2023 Anchor-Free 设计、C2f 模块(CSPLayer 改进)、解耦头(Decoupled Head)、任务统一(检测 / 分割 / 姿态 / 分类) 新一代基线:架构现代化,支持实例分割与姿态估计
    YOLOv9 2024 可编程梯度信息(PGI)、通用高效层聚合网络(GELAN)、辅助可逆分支 信息瓶颈突破:解决深度网络信息衰减问题,轻量级模型表现优异
    YOLOv10 2024 无 NMS 端到端设计、一致性双标签分配(TAL)、效率驱动的模型设计 去除后处理:消除 NMS 延迟,实现真正端到端检测
    YOLOv11 2024 C3k2 模块(C2f 改进)、大核可分离卷积(LKA)、注意力机制集成 效率 + 精度平衡:Ultralytics 最新版,进一步优化计算效率
    YOLOv12 2024 区域注意力机制(AAttn)、R-ELAN 架构、FlashAttention 优化、纯 Transformer 风格设计 注意力融入 YOLO:首次在保持实时性的前提下引入全局注意力

    五、总结

            YOLO 是经典一阶段目标检测 CV 模型,核心就是把检测问题转化回归问题,一次卷积同时输出物体位置与类别,主打实时高速。 但 YOLO 只完成 “看见、定位物体”,不具备高级语义理解能力。现在的工程方案,大多是「YOLO 等传统 CV 小模型做感知 + VLM 多模态大模型做推理」的组合,两者各司其职。

    模型能力输出形式推理能力
    YOLO 目标定位、识别物体类别 坐标框、置信度、类别 ID ❌无语义推理,只识别特征
    VLM 多模态大模型 (Qwen‑VL/InternVL) 看图理解、问答、逻辑推理 自然语言文本 ✅具备推理,能回答复杂业务问题

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » yolo模型介绍
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!