目录
一、Yolo介绍
二、Yolo和CNN
三、Yolo的原理
Yolo的原理
非极大值抑制(NMS)
损失函数
四、Yolo的发展史
五、总结
上一篇内容 PDF解析工具-MinerU 中提到了yolo模型。YOLO(You Only Look Once)属于传统计算机视觉 CV (Computer Vision)模型,和 Qwen‑VL 这类多模态大模型能力有本质区别。YOLO 负责画框定位物体,没有高级语义推理;多模态大模型可以看懂画面、做逻辑推理。
一、Yolo介绍
在各类实际业务场景里,目标检测任务占比最高;如下是真实使用场景中,对车画了一个框,并在上面的标签(label)上写了识别物体的种类。

目前目标检测分为两大技术路线:
Two-stage方法准确度高一些,但速度慢,one-stage算 法是速度快,但是准确性低一些
YOLO 名字含义:You Only Look Once,图片只看一次就完成全部检测。
YOLO的特点:速度快,能够达到实时的要求,泛化能力强。广泛应用于各种需要目标检测的场景:
• 自动驾驶:检测道路上的车辆、行人、交通标志等,为自动驾驶系统提供决策依据。
• 安防监控:在视频监控中实时检测可疑人物或物体,提高安防效率。
• 机器人视觉:帮助机器人识别和定位周围的物体,实现自主导航和操作。
• 智能交通:用于交通流量监测、违章检测等,提高交通管理的智能化水平。
YOLO是一种非常有影响力的实时目标检测算法,以快速、高效的特点在很多领域都发挥了重要作用。当然在实际工程中,YOLO也并不一定能完全满足需求,需要和多模态大模型经常搭配使用,如:
二、Yolo和CNN
CNN (卷积神经网络) 我们在前面介绍过:卷积神经网络(CNN) 是做特征提取的关键工具。比如我们想要区分人:
• 先用S细胞(卷积)找到无数个小碎片(横线、竖线、圆弧)。
• 再用C细胞(池化)忽略掉无关紧要的位置抖动。
• 最后层层叠加,把线条拼成眼睛,把眼睛拼成脸,把脸拼成完整的人。
那么通过CNN学习,背景部位的激活度基本很少。卷积层数越多,学习到的特征越高阶。
YOLO (You Only Look Once) 是 解决方案/架构 。 它是一个设计精妙的算法框架。把这一堆CNN 按照特定的顺序组装起来,不仅要看懂图,还要算出物体在哪个位置(坐标)。如果把CNN 看作砖块,YOLO 是用砖块盖起来的摩天大楼。
三、Yolo的原理
Yolo的原理
1)网格划分:把输入图片切分为 S×S 的网格(YOLO‑V1 是 7×7,共 49 个格子)。

2)每个网格输出预测 每个网格预测 B 个边界框 BBox,每个框输出 5 个值:中心点 x、y,宽 w,高 h,置信度 confidence(0~1,表示预测框的可信程度);同时输出 C 个类别的概率。
这个B是自己来设定的,假如设B等于2,一个格子里面最多可以包含两个物体,C是能识别的物体的种类。到底能识别多少种物体,需要提前对yolo模型进行训练。
每个网格输出的向量长度为 len = B * 5 + C
把所有网格拼在一起,最终输出张量形状:(S,S,len)
3)卷积做特征提取

非极大值抑制(NMS)
非极大值抑制 NMS 同一个物体会被多个网格重复预测,生成大量重叠框。通过 IOU 交并比计算框重叠程度,保留置信度最高的框,过滤掉重复冗余框,得到最终干净的检测结果。

具体流程如下:
step 1:将重复预测框按照置信度排序,保留置信度最高的A框作为基准框
step 2:将框A和其他框计算交并比,如果交并比大于某个阈值,那么说明重叠严重,去掉
循环以上步骤,直到所有框处理完毕。
损失函数
yolo的速度快,是因为它只经过一次计算就预测了物体的类别和位置。他的误差有分类误差和定位误差。

四、Yolo的发展史
YOLO 版本演进表:
| YOLOv1 | 2015 | 单阶段检测开山之作,S×S 网格划分 + 直接回归坐标与类别 | 速度革命:首次实现实时检测(45 FPS),将检测视为回归问题 |
| YOLOv2 | 2016 | 引入 Anchor Box、批归一化(BN)、多尺度训练(Multi-Scale)、高分辨率分类器 | 精度大幅提升:mAP 从 63.4% 提升至 78.6%,支持 9000+ 类别(YOLO9000) |
| YOLOv3 | 2018 | 多尺度预测(13×13/26×26/52×52)、特征金字塔网络(FPN)、独立逻辑分类器 | 小目标检测增强:Darknet-53 backbone,兼顾速度与精度 |
| YOLOv4 | 2020 | CSPDarknet53 骨干、Mosaic 数据增强、CIoU Loss、DropBlock 正则化、SPP+PAN Neck | 工业落地标杆:系统验证 Bag of Freebies 与 Bag of Specials 技巧组合 |
| YOLOv5 | 2020 | Ultralytics 工程化实现、PyTorch 原生、AutoAnchor、模型缩放(n/s/m/l/x)、ONNX 导出 | 工程化典范:易用性极佳,社区生态最活跃,部署友好 |
| YOLOv6 | 2022 | 美团开源、RepVGG 重参数化、更高效的 Neck 设计、硬件感知量化(QAT) | 产业落地:专精工业场景,推理速度优化显著 |
| YOLOv7 | 2022 | E-ELAN 架构、模型重参数化、动态标签分配、扩展的高效层聚合网络 | 学术 + 工程并重:训练成本降低,实时性与精度双优 |
| YOLOv8 | 2023 | Anchor-Free 设计、C2f 模块(CSPLayer 改进)、解耦头(Decoupled Head)、任务统一(检测 / 分割 / 姿态 / 分类) | 新一代基线:架构现代化,支持实例分割与姿态估计 |
| YOLOv9 | 2024 | 可编程梯度信息(PGI)、通用高效层聚合网络(GELAN)、辅助可逆分支 | 信息瓶颈突破:解决深度网络信息衰减问题,轻量级模型表现优异 |
| YOLOv10 | 2024 | 无 NMS 端到端设计、一致性双标签分配(TAL)、效率驱动的模型设计 | 去除后处理:消除 NMS 延迟,实现真正端到端检测 |
| YOLOv11 | 2024 | C3k2 模块(C2f 改进)、大核可分离卷积(LKA)、注意力机制集成 | 效率 + 精度平衡:Ultralytics 最新版,进一步优化计算效率 |
| YOLOv12 | 2024 | 区域注意力机制(AAttn)、R-ELAN 架构、FlashAttention 优化、纯 Transformer 风格设计 | 注意力融入 YOLO:首次在保持实时性的前提下引入全局注意力 |
五、总结
YOLO 是经典一阶段目标检测 CV 模型,核心就是把检测问题转化回归问题,一次卷积同时输出物体位置与类别,主打实时高速。 但 YOLO 只完成 “看见、定位物体”,不具备高级语义理解能力。现在的工程方案,大多是「YOLO 等传统 CV 小模型做感知 + VLM 多模态大模型做推理」的组合,两者各司其职。
| YOLO | 目标定位、识别物体类别 | 坐标框、置信度、类别 ID | ❌无语义推理,只识别特征 |
| VLM 多模态大模型 (Qwen‑VL/InternVL) | 看图理解、问答、逻辑推理 | 自然语言文本 | ✅具备推理,能回答复杂业务问题 |
网硕互联帮助中心







评论前必须登录!
注册