原文地址
YOLO26: Key Architectural Enhancements and Performance Benchmarking for Real-Time Object Detection (arxiv.org)
目录
原文地址
YOLO26:面向实时目标检测的关键架构增强与性能基准测试
1 引言
2 YOLO26的架构增强
2.1 移除分布焦点损失(DFL)
2.2 端到端无NMS推理
2.3 ProgLoss和STAL:增强的训练稳定性与小目标检测
2.4 用于稳定收敛的MuSGD优化器
3 基准测试与比较分析
3.1 检测与分割性能指标
3.2 分类性能指标(ImageNet)
3.3 姿态性能指标(COCO)
3.4 DOTA v1上的定向目标检测(OBB)性能
4 使用Ultralytics YOLO26进行实时部署
4.1 灵活的导出与集成路径
4.2 量化与资源受限设备
4.3 跨行业应用:从机器人到制造
4.4 YOLO26部署的更广泛见解
5 结论与未来方向
5.1 未来方向
YOLO26:面向实时目标检测的关键架构增强与性能基准测试
作者:Ranjan Sapkota¹ Rahul Harsha Cheppally² Ajay Sharda² Manoj Karkee¹
¹康奈尔大学 生物与环境工程系,纽约州伊萨卡,14850,美国
²堪萨斯州立大学 生物与农业工程系,堪萨斯州曼哈顿,66502,美国
摘要:本研究对Ultralytics YOLO26进行了全面分析,重点介绍其针对实时边缘目标检测的关键架构增强与性能基准测试。YOLO26于2025年9月发布,作为YOLO家族最新且最先进的成员,专为在边缘和低功耗设备上实现效率、精度与部署就绪性而构建。本文依次详细介绍了YOLO26的架构创新,包括移除分布焦点损失(Distribution Focal Loss, DFL)、采用端到端无NMS(Non-Maximum Suppression)推理、集成ProgLoss(渐进损失平衡)与小目标感知标签分配(Small-Target-Aware Label Assignment, STAL),以及引入MuSGD优化器以实现稳定收敛。除架构外,本文将YOLO26定位为多任务框架,支持目标检测、实例分割、姿态/关键点估计、定向检测和分类。我们在NVIDIA Jetson Nano和Orin等边缘设备上展示了YOLO26的性能基准,并将其结果与YOLOv8、YOLOv11、YOLOv12、YOLOv13以及基于Transformer的检测器进行比较。本文进一步探讨了实时部署路径、灵活的导出选项(ONNX、TensorRT、CoreML、TFLite)以及INT8/FP16量化。重点介绍了YOLO26在机器人、制造和物联网领域的实际应用案例,以展示其跨行业适应性。最后,讨论了部署效率和更广泛影响的见解,并概述了YOLO26及YOLO系列的未来发展方向。
关键词:YOLO26 ⋅ 边缘AI ⋅ 多任务目标检测 ⋅ 无NMS推理 ⋅ 小目标识别 ⋅ 你只需看一次(You Only Look Once)⋅ 目标检测 ⋅ MuSGD优化器
1 引言
目标检测已成为计算机视觉中最关键的任务之一,使机器能够在图像或视频流中定位和分类多个目标(Zhao et al., 2019; Zou et al., 2023)。从自动驾驶和机器人到监控、医学影像、农业和智能制造,实时目标检测算法是人工智能(AI)应用的支柱(Rana and others, 2024; Khan et al., 2025)。在这些算法中,你只需看一次(YOLO)家族已成为最具影响力的实时目标检测模型系列,将精度与前所未有的推理速度相结合(Sapkota et al., 2025b, a, 2024, 2024)。自2016年推出以来,YOLO经历了多次架构修订,每次都在整合神经网络设计、损失函数和部署效率方面前沿进展的同时,解决了前代产品的局限性(Sapkota et al., 2025b)。
2025年9月YOLO26的发布标志着YOLO系列最新的里程碑,将设计重点从增量式架构复杂性转向面向部署的简化——最显著的是通过 streamlined 回归、端到端预测行为以及通过新颖优化实现的训练时改进。这种边缘优先的理念体现在图1a的精度-延迟趋势比较中,Ultralytics报告了YOLO26在COCO mAP(50-95)与延迟性能(T4, TensorRT10, FP16)方面与广泛的先前YOLO变体(YOLO11、YOLOv10、YOLOv9、YOLOv8、YOLOv7、YOLOv6-3.0、YOLOv5)以及竞争性实时检测器(PP-YOLOE+、DAMO-YOLO和RTMDet)的对比。作为补充,图1b将YOLO26置于相同的COCO mAP(50-95)与端到端延迟坐标轴上,与基于Transformer的实时基线(YOLOv10和RT-DETR家族)进行比较,强调YOLO26旨在保持高检测质量的同时降低整体管道延迟,这对于低功耗和延迟敏感型边缘设备尤其相关的权衡。
图1:在NVIDIA T4 GPU上TensorRT FP16条件下YOLO26的性能比较(来源链接)。(a) COCO mAP(50–95)与推理延迟(毫秒/图像),将YOLO26与早期YOLO版本和其他实时检测器进行比较,突出其改进的精度-速度权衡。(b) COCO mAP(50–95)与端到端延迟,将YOLO26与YOLOv10和RT-DETR变体进行比较,说明其在整体管道效率方面的优势。
表1提供了从YOLOv1到YOLOv13以及YOLOv26的YOLO模型的详细比较,突出其发布年份、关键架构创新、性能增强和开发框架。
表1:YOLOv1至YOLOv13及YOLOv26模型摘要:发布年份、架构、创新、框架
表格
| 模型(年份) | 关键架构创新与贡献 | 任务 | 框架 |
|---|---|---|---|
| YOLOv1 (2015) Redmon et al. (2016) | 首个统一的单阶段目标检测器(一个网络同时预测边界框+类别概率)。 | 目标检测、分类 | Darknet |
| YOLOv2 (2016) Redmon and Farhadi (2017) | 引入多尺度训练;锚框维度聚类以改进先验框(YOLO9000联合检测/分类)。 | 目标检测、分类 | Darknet |
| YOLOv3 (2018) Redmon and Farhadi (2018) | 更深的Darknet-53骨干网络带残差连接;添加SPP模块和多尺度特征融合以检测小目标。 | 目标检测、多尺度检测 | Darknet |
| YOLOv4 (2020) Bochkovskiy et al. (2020) | 采用Mish激活函数;CSPDarknet-53骨干网络(跨阶段部分网络)以增强特征复用。 | 目标检测、目标跟踪 | Darknet |
| YOLOv5 (2020)(来源链接) | Ultralytics的PyTorch实现;无锚点检测头选项;使用SiLU(Swish)激活和PANet颈部进行特征聚合。 | 目标检测、实例分割(有限) | PyTorch (Ultralytics) |
| YOLOv6 (2022) Li et al. (2022a) | EfficientRep骨干网络嵌入自注意力;引入无锚点目标检测模式以提高效率。 | 目标检测、实例分割 | PyTorch |
| YOLOv7 (2022) Wang et al. (2023) | 扩展的ELAN(E-ELAN)骨干网络带模型重参数化;集成基于Transformer的模块以支持更广泛任务(如跟踪)。 | 目标检测、目标跟踪、实例分割 | PyTorch |
| YOLOv8 (2023)(来源链接) | Ultralytics下一代模型;新的C2f骨干网络和解耦头;结合生成技术(基于GAN的增强)和完全无锚点设计。 | 目标检测、实例分割、全景分割、关键点估计 | PyTorch (Ultralytics) |
| YOLOv9 (2024) Wang et al. (2024b) | 引入可编程梯度信息(PGI)用于选择性学习;提出G-ELAN(增强型ELAN架构)以改进特征提取。 | 目标检测、实例分割 | PyTorch |
| YOLOv10 (2024) Wang et al. (2024a) | 通过一致的双重分配训练策略实现端到端无NMS检测(移除后处理)。 | 目标检测 | PyTorch |
| YOLO11 (2024)(来源链接) | 在整个骨干网络/颈部添加C3k2 CSP瓶颈(更小卷积核CSP块);保留SPPF并引入C2PSA(带空间注意力的CSP)模块以关注重要区域。将YOLO扩展到姿态估计和定向目标检测任务。 | 目标检测、实例分割、姿态估计、定向检测 | PyTorch (Ultralytics) |
| YOLOv12 (2025) Tian et al. (2025b) | 以注意力为中心的架构:引入高效区域注意力模块(低复杂度全局自注意力)和残差ELAN(R-ELAN)块以改进特征聚合,在YOLO速度下实现Transformer级精度。 | 目标检测 | PyTorch |
| YOLOv13 (2025) Lei et al. (2025) | 基于超图的自适应相关性增强(HyperACE)模块以捕获全局高阶特征交互;全流程聚合-分布(FullPAD)方案以增强网络中的特征流;利用深度可分离卷积降低复杂度。 | 目标检测 | PyTorch |
| YOLOv26 (2025)(来源链接) | Ultralytics边缘优化模型:通过原生端到端预测器消除NMS;移除DFL(分布焦点损失)以实现更简单、更快的推理;引入MuSGD优化器(SGD+Muon混合)以实现稳定快速收敛;显著提高小目标精度,CPU推理速度提升高达43%,适用于低功耗设备部署。 | 目标检测、实例分割、姿态估计、定向检测、分类 | PyTorch (Ultralytics) |
YOLO框架由Joseph Redmon及其同事于2016年首次提出,引入了目标检测的范式转变(Redmon et al., 2016)。与将区域提议与分类分离的传统两阶段检测器(如R-CNN(He et al., 2017)和Faster R-CNN(Ren et al., 2016))不同,YOLO将检测表述为单一的回归问题(Diwan et al., 2023)。通过单次前向传播直接预测边界框和类别概率,YOLO在保持有竞争力的精度的同时实现了实时速度(Ali and Zhang, 2024; Diwan et al., 2023)。这种效率使YOLOv1对延迟至关重要的应用(包括机器人、自主导航和实时视频分析)极具吸引力。后续版本YOLOv2(2017)(Redmon and Farhadi, 2017)和YOLOv3(2018)(Redmon and Farhadi, 2018)在保持实时性能的同时显著提高了精度。YOLOv2引入了批量归一化、锚框和多尺度训练,提高了对不同尺寸目标的鲁棒性。YOLOv3利用基于Darknet-53的更深架构以及多尺度特征图,更好地检测小目标。这些增强使YOLOv3成为学术和工业应用的事实标准(Apostolidis and Papakostas, 2025; Sapkota et al., 2025b; Edozie et al., 2025)。
随着对更高精度的需求增长,特别是在航空影像、农业和医学分析等具有挑战性的领域,YOLO模型发展为更先进的架构。YOLOv4(2020)(Bochkovskiy et al., 2020)引入了跨阶段部分网络(CSPNet)、改进的激活函数如Mish,以及包括马赛克数据增强和CIoU损失在内的先进训练策略。YOLOv5(Ultralytics, 2020)虽非官方版本,但因其PyTorch实现、广泛的社区支持以及跨多样平台的简化部署而广受欢迎。YOLOv5还带来了模块化,使其更容易适应分割、分类和边缘应用。进一步发展包括YOLOv6(Li et al., 2022a)和YOLOv7(Wang et al., 2023)(2022),它们集成了先进的优化技术、参数高效模块和受Transformer启发的块。这些迭代将YOLO推向最先进(SoTA)精度基准,同时保持对实时推理的关注。至此,YOLO生态系统已牢固确立为目标检测研究和部署的领先模型家族。
作为主要维护者,Ultralytics通过YOLOv8(2023)(Sohan et al., 2024)重新定义了该框架。YOLOv8采用了解耦检测头、无锚点预测和精细的训练策略,在精度和部署多功能性方面实现了实质性改进(Farooq et al., 2024)。由于其简洁的Python API、与TensorRT、CoreML和ONNX的兼容性,以及针对速度与精度权衡优化的变体(nano、small、medium、large和extra-large),它在工业界被广泛采用。YOLOv9(Wang et al., 2024b)、YOLOv10(Wang et al., 2024a)和YOLO11紧随其后,每次迭代都在推动架构和性能的边界。YOLOv9引入了GELAN(广义高效层聚合网络)和渐进蒸馏,将效率与更高的表征能力相结合。YOLOv10专注于通过混合任务对齐分配平衡精度和推理延迟。YOLOv11进一步完善了Ultralytics的愿景,在保持强大小目标性能的同时提供更高的GPU效率(Sapkota et al., 2025b)。这些模型共同巩固了Ultralytics生产面向现代部署管道的即用型YOLO版本的声誉。
继YOLO11之后,替代版本YOLOv12(Tian et al., 2025b)和YOLOv13(Lei et al., 2025)引入了以注意力为中心的设计和先进的架构组件,试图在各种数据集上最大化精度。这些模型探索了多头自注意力、改进的多尺度融合和更强的训练正则化策略。虽然它们提供了强大的基准,但仍依赖非极大值抑制(NMS)和分布焦点损失(DFL),这引入了延迟开销和导出挑战,特别是对于低功耗设备。NMS-based后处理和复杂损失公式的局限性推动了YOLO26的开发(Ultralytics YOLO26官方来源)。到2025年9月,在伦敦的YOLO Vision 2025活动上,Ultralytics发布了YOLO26,作为面向边缘计算、机器人和移动AI的下一代模型。
YOLO26围绕三个指导原则构建:简单性、效率和创新。图2概述展示了这些选择及其支持的五项任务:目标检测、实例分割、姿态/关键点检测、定向检测和分类。在推理路径上,YOLO26消除了NMS,产生原生端到端预测,移除了主要的后处理瓶颈,减少了延迟方差,并简化了跨部署的阈值调整。在回归方面,它移除了DFL,将分布式框解码转变为更轻量、硬件友好的公式,可干净地导出到ONNX、TensorRT、CoreML和TFLite——这对边缘和移动管道是实用的胜利。这些改变共同产生了更精简的图、更快的冷启动和更少的运行时依赖,这对CPU受限和嵌入式场景特别有益。通过ProgLoss(渐进损失平衡)和STAL(小目标感知标签分配)解决了训练稳定性和小目标保真度问题。ProgLoss自适应地重新加权目标,防止在训练后期被简单样本主导,而STAL优先为微小或遮挡实例分配标签,提高在杂乱、树叶或运动模糊条件下的召回率(这在航空、机器人和智能摄像头 feed 中很常见)。优化由MuSGD驱动,这是一种混合优化器,结合了SGD的泛化能力与受Muon式方法启发的动量/曲率行为,实现更快、更平滑的收敛和跨规模的更可靠平台期。
功能上,如图2再次强调,YOLO26的五种能力共享统一的骨干/颈部和精简的头部:
目标检测:无锚点、无NMS的框和分数
实例分割:与共享特征耦合的轻量级掩码分支
姿态/关键点检测:用于人体或部件关键点的紧凑关键点头部
定向检测:用于倾斜目标和细长目标的旋转框
分类:用于纯识别任务的单标签逻辑
这种整合设计允许多任务训练或特定任务微调而无需架构返工,同时简化的导出保持了跨加速器的可移植性。总之,YOLO26通过将端到端推理和无DFL回归与ProgLoss、STAL和MuSGD相结合,推进了YOLO系列,产生了一个部署更快、训练更稳定、能力更广泛的模型,如图2所直观总结。
图2:YOLO26统一架构支持五项关键视觉任务:目标检测、实例分割、姿态/关键点检测、定向检测和分类。
2 YOLO26的架构增强
YOLO26的架构遵循为跨边缘和服务器平台的实时目标检测而专门构建的精简高效管道。如图3所示,该过程始于输入数据(图像或视频流)的摄取,这些数据首先通过预处理操作(包括调整大小和归一化)以调整为适合模型推理的标准尺寸。然后将数据送入骨干特征提取阶段,其中紧凑而强大的卷积网络捕获视觉模式的层次表征。为了增强跨尺度的鲁棒性,架构生成多尺度特征图(图3),为大目标和小目标保留语义丰富性。然后这些特征图在轻量级特征融合颈部内合并,其中以计算高效的方式集成信息。检测特定处理发生在直接回归头中,与先前的YOLO版本不同,它输出边界框和类别概率而无需依赖非极大值抑制(NMS)。这种端到端的无NMS推理(图3)消除了后处理开销并加速了部署。ProgLoss平衡和STAL分配模块强化了训练稳定性和精度,确保损失项的公平加权并改进小目标检测。模型优化由MuSGD优化器指导,结合SGD和Muon的优势以实现更快更可靠的收敛。通过量化进一步增强部署效率,支持FP16和INT8精度,在最小精度降级的情况下在CPU、NPU和GPU上加速。最后,管道在生成输出预测(包括可叠加在输入图像上可视化的边界框和类别分配)中达到顶峰。总体而言,YOLO26的架构展示了一种精心平衡的设计理念,同时推进了精度、稳定性和部署简单性。
图3:Ultralytics YOLO26目标检测和分割算法的简化核心架构图
图4:YOLO26的关键架构增强:(a) 移除分布焦点损失(DFL)简化了边界框回归,提升了效率和导出兼容性。(b) 端到端无NMS推理消除了后处理瓶颈,实现更快更简单的部署。(c) ProgLoss和STAL增强了训练稳定性并显著提高小目标检测精度。(d) MuSGD优化器结合SGD和Muon的优势,在训练中实现更快、更稳定的收敛。
YOLO26引入了几项关键的架构创新,使其有别于前几代YOLO模型。这些增强不仅提高了训练稳定性和推理效率,而且从根本上重塑了实时边缘设备的部署管道。在本节中,我们描述了YOLO26的四大贡献:(i) 移除分布焦点损失(DFL),(ii) 引入端到端无NMS(非极大值抑制)推理,(iii) 包括渐进损失平衡(ProgLoss)和小目标感知标签分配(STAL)在内的新颖损失函数策略,以及(iv) 开发MuSGD优化器以实现稳定和高效收敛。详细讨论每项架构增强,并提供比较见解,突出其相对于早期YOLO版本(如YOLOv8、YOLOv11、YOLOv12和YOLOv13)的优势。
2.1 移除分布焦点损失(DFL)
YOLO26最显著的架构简化之一是移除分布焦点损失(DFL)模块(图4a),该模块曾存在于先前的YOLO版本(如YOLOv8和YOLOv11)中。DFL最初旨在通过预测框坐标的概率分布来改进边界框回归,从而允许更精确的目标定位。虽然这种策略在早期模型中展示了精度增益,但它也引入了非平凡的计算开销和导出困难。在实践中,DFL在推理和模型导出期间需要专门处理,这增加了针对硬件加速器(如ONNX、CoreML、TensorRT或TFLite)的部署管道的复杂性。
通过消除DFL,YOLO26简化了模型架构,使边界框预测成为更直接的回归任务,而不牺牲性能。比较分析表明,YOLO26实现了与基于DFL的YOLO模型相当或更优的精度,特别是当与ProgLoss和STAL等其他创新结合时。此外,DFL的移除显著减少了推理延迟并提高了跨平台兼容性。这使得YOLO26更适合边缘AI场景,其中轻量级和硬件友好型模型至关重要。
相比之下,YOLOv12和YOLOv13等模型在其架构中保留了DFL,尽管它们在GPU丰富的环境中具有强大的精度基准,但这限制了它们在受限设备上的适用性。因此,YOLO26标志着将最先进的目标检测性能与移动、嵌入式和工业应用现实对齐的决定性一步。
2.2 端到端无NMS推理
YOLO26的另一个突破性特性是其对无NMS(非极大值抑制)端到端推理的原生支持(见图4b)。传统的YOLO模型(包括YOLOv8到YOLOv13)严重依赖NMS作为后处理步骤,通过仅保留具有最高置信度分数的边界框来过滤重复预测。虽然有效,但NMS为管道增加了额外延迟,并需要手动调整的超参数,如交并比(IoU)阈值。这种对手工后处理步骤的依赖在部署管道中引入了脆弱性,特别是对于边缘设备和延迟敏感型应用。
YOLO26从根本上重新设计了预测头,以产生直接的、非冗余的边界框预测,而无需NMS。这种端到端设计不仅减少了推理复杂性,而且消除了对手动调整阈值的依赖,从而简化了集成到生产系统中。比较基准测试表明,YOLO26比YOLOv11和YOLOv12实现了更快的推理速度,nano模型的CPU推理时间减少了高达43%。这使得YOLO26在移动设备、无人机和嵌入式机器人平台中特别具有优势,其中毫秒级的延迟可能产生实质性的操作影响。
除了速度之外,无NMS方法提高了可重复性和部署可移植性,因为模型不再需要广泛的后处理代码。虽然其他先进检测器(如RT-DETR和Sparse R-CNN)已尝试无NMS推理,但YOLO26代表了第一个采用此范式同时保持YOLO标志性速度与精度平衡的YOLO版本。与仍依赖NMS的YOLOv13相比,YOLO26的端到端管道作为实时检测的前瞻性架构脱颖而出。
2.3 ProgLoss和STAL:增强的训练稳定性与小目标检测
训练稳定性和小目标识别仍然是目标检测中持续的挑战。YOLO26通过集成两种新颖策略来解决这些问题:渐进损失平衡(ProgLoss)和小目标感知标签分配(STAL),如图(图4c)所示。
ProgLoss在训练期间动态调整不同损失组件的权重,确保模型不会对主导目标类别过拟合,而在稀有或小类别上表现不佳。这种渐进重新平衡改进了泛化并防止训练后期的不稳定性。另一方面,STAL明确优先为小目标分配标签,由于小目标的像素表示有限且易受遮挡影响,特别难以检测。ProgLoss和STAL共同为YOLO26在具有小目标或遮挡目标的数据集(如COCO和无人机影像基准)上提供了实质性的精度提升。
相比之下,YOLOv8和YOLOv11等早期模型没有整合此类针对性机制,通常需要数据集特定的增强或外部训练技巧来实现可接受的小目标性能。YOLOv12和YOLOv13试图通过基于注意力的模块和增强的多尺度特征融合来弥补这一差距;然而,这些解决方案增加了架构复杂性和推理成本。YOLO26以更轻量级的方法实现了类似或更优的改进,强化了其对边缘AI应用的适用性。通过集成ProgLoss和STAL,YOLO26确立了自己作为鲁棒的小目标检测器,同时保持了YOLO家族的效率和可移植性。
2.4 用于稳定收敛的MuSGD优化器
YOLO26的最终创新是引入了MuSGD优化器(图4d),它结合了随机梯度下降(SGD)的优势与最近提出的Muon优化器,这是一种受大型语言模型(LLM)训练优化策略启发的技术。MuSGD利用SGD的鲁棒性和泛化能力,同时结合来自Muon的自适应特性,实现更快的收敛和跨多样数据集的更稳定优化。
这种混合优化器反映了现代深度学习中的一个重要趋势:自然语言处理(NLP)与计算机视觉之间进展的交叉授粉。通过借鉴LLM训练实践(例如Moonshot AI的Kimi K2),YOLO26从以前在YOLO系列中未探索的稳定性增强中受益。实证结果表明,MuSGD使YOLO26能够在更少的训练周期内达到有竞争力的精度,减少了训练时间和计算成本。
先前的YOLO版本(包括YOLOv8到YOLOv13)依赖标准SGD或AdamW变体。虽然有效,但这些优化器需要广泛超参数调整,有时表现出不稳定的收敛,特别是在高变异性的数据集上。相比之下,MuSGD提高了可靠性,同时保留了YOLO的轻量级训练理念。对于从业者来说,这转化为更短的开发周期、更少的训练重启以及跨部署场景更可预测的性能。通过集成MuSGD,YOLO26不仅将自己定位为推理优化的模型,而且也是研究人员和工业从业者都友好的训练架构。
3 基准测试与比较分析
3.1 检测与分割性能指标
如表2中检测结果的总结,YOLO26随着模型规模的增加持续提高COCO mAP(50–95),同时在CPU(ONNX)和GPU(TensorRT)运行时保持可预测且低的推理延迟。特别是,YOLO26-m和YOLO26-l分别实现了高于53%和55% mAP的强检测精度,延迟远低于基于Transformer的替代方案,反映了其无NMS推理路径和简化回归设计的优势。同一张表进一步突出了参数和FLOPs中有利的扩展行为,强化了YOLO26跨部署目标的效率。
除了检测之外,表2中的分割结果表明YOLO26在多任务设置中保留了这些优势。从nano到extra-large变体,YOLO26-seg模型提供有竞争力的框和掩码mAP,同时保持可管理的计算成本和实时吞吐量,即使在端到端评估下也是如此。与依赖更重Transformer编码器的YOLOv10和RT-DETR变体等架构相比,YOLO26表现出更平衡的精度-延迟曲线,特别是对于边缘和CPU受限推理。总之,表2中的检测和分割基准表明,YOLO26不仅仅是增量改进,而是YOLO家族面向部署的演进,在严格延迟约束下有效桥接了效率导向设计与高精度实时感知。
表2:Ultralytics YOLO26性能指标(640像素)。检测(上)和实例分割(下)结果报告COCO验证精度、端到端(e2e)分数(如适用),以及CPU(ONNX)和NVIDIA T4(TensorRT10 FP16)上的速度,还有模型大小(参数量)和计算量(FLOPs)。
检测
表格
| 模型 | 尺寸(像素) | mAPval 50-95 | mAPval 50-95 (e2e) | 速度 CPU ONNX (ms) | 速度 T4 TRT10 (ms) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|---|
| YOLO26n | 640 | 40.9 | 40.1 | 38.9±0.7 | 1.7±0.0 | 2.4 | 5.4 |
| YOLO26s | 640 | 48.6 | 47.8 | 87.2±0.9 | 2.5±0.0 | 9.5 | 20.7 |
| YOLO26m | 640 | 53.1 | 52.5 | 220.0±1.4 | 4.7±0.1 | 20.4 | 68.2 |
| YOLO26l | 640 | 55.0 | 54.4 | 286.2±2.0 | 6.2±0.2 | 24.8 | 86.4 |
| YOLO26x | 640 | 57.5 | 56.9 | 525.8±4.0 | 11.8±0.2 | 55.7 | 193.9 |
实例分割
表格
| 模型 | 尺寸(像素) | mAPbox 50-95 (e2e) | mAPmask 50-95 (e2e) | 速度 CPU ONNX (ms) | 速度 T4 TRT10 (ms) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|---|
| YOLO26n-seg | 640 | 39.6 | 33.9 | 53.3±0.5 | 2.1±0.0 | 2.7 | 9.1 |
| YOLO26s-seg | 640 | 47.3 | 40.0 | 118.4±0.9 | 3.3±0.0 | 10.4 | 34.2 |
| YOLO26m-seg | 640 | 52.5 | 44.1 | 328.2±2.4 | 6.7±0.1 | 23.6 | 121.5 |
| YOLO26l-seg | 640 | 54.4 | 45.5 | 387.0±3.7 | 8.0±0.1 | 28.0 | 139.8 |
| YOLO26x-seg | 640 | 56.5 | 47.0 | 787.0±6.8 | 16.4±0.1 | 62.8 | 313.5 |
3.2 分类性能指标(ImageNet)
表3总结了YOLO26跨模型规模的ImageNet分类性能。随着模型容量从YOLO26n增加到YOLO26x,Top-1精度从71.4%稳步提高到79.9%,同时所有变体保持高于90%的强Top-5精度。重要的是,这种精度扩展是以可预测的延迟增长实现的,因为即使是最大模型的TensorRT FP16推理也保持在4毫秒以下。表3中报告的紧凑FLOPs和参数数量突出了YOLO26分类头部保持了效率,使其非常适合边缘和嵌入式平台上的实时图像识别。
表3:YOLO26在224像素分辨率下的ImageNet图像分类性能。结果报告Top-1/Top-5精度、CPU(ONNX)和NVIDIA T4(TensorRT10 FP16)上的推理速度,以及模型大小和FLOPs。
表格
| 模型 | 尺寸(像素) | Top-1精度 | Top-5精度 | 速度 CPU ONNX (ms) | 速度 T4 TRT10 (ms) | 参数量 (M) | FLOPs (B @224) |
|---|---|---|---|---|---|---|---|
| YOLO26n-cls | 224 | 71.4 | 90.1 | 5.0±0.3 | 1.1±0.0 | 2.8 | 0.5 |
| YOLO26s-cls | 224 | 76.0 | 92.9 | 7.9±0.2 | 1.3±0.0 | 6.7 | 1.6 |
| YOLO26m-cls | 224 | 78.1 | 94.2 | 17.2±0.4 | 2.0±0.0 | 11.6 | 4.9 |
| YOLO26l-cls | 224 | 79.0 | 94.6 | 23.2±0.3 | 2.8±0.0 | 14.1 | 6.2 |
| YOLO26x-cls | 224 | 79.9 | 95.0 | 41.4±0.9 | 3.8±0.0 | 29.6 | 13.6 |
3.3 姿态性能指标(COCO)
表4展示了YOLO26在COCO数据集上的姿态估计性能。跨模型规模,YOLO26在端到端评估下表现出mAPpose的持续提升,从nano变体的57.2%到extra-large模型的71.6%。这种精度改进伴随着延迟和计算成本的可预测扩展,同时在GPU上保持实时推理,在CPU上保持近实时性能。表4中的结果表明,YOLO26有效地将其面向效率的设计扩展到姿态估计,使其适用于边缘和服务器平台上的实时人体和物体关键点分析。
表4:YOLO26在640像素分辨率下COCO数据集的姿态估计性能。结果报告端到端(e2e)姿态精度、CPU(ONNX)和NVIDIA T4(TensorRT10 FP16)上的推理速度,以及模型大小和FLOPs。
表格
| 模型 | 尺寸(像素) | mAPpose 50-95 (e2e) | mAPpose 50 (e2e) | 速度 CPU ONNX (ms) | 速度 T4 TRT10 (ms) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|---|
| YOLO26n-pose | 640 | 57.2 | 83.3 | 40.3±0.5 | 1.8±0.0 | 2.9 | 7.5 |
| YOLO26s-pose | 640 | 63.0 | 86.6 | 85.3±0.9 | 2.7±0.0 | 10.4 | 23.9 |
| YOLO26m-pose | 640 | 68.8 | 89.6 | 218.0±1.5 | 5.0±0.1 | 21.5 | 73.1 |
| YOLO26l-pose | 640 | 70.4 | 90.5 | 275.4±2.4 | 6.5±0.1 | 25.9 | 91.3 |
| YOLO26x-pose | 640 | 71.6 | 91.6 | 565.4±3.0 | 12.2±0.2 | 57.6 | 201.7 |
3.4 DOTA v1上的定向目标检测(OBB)性能
表5报告了YOLO26在DOTA v1数据集上的定向目标检测性能。YOLO26随着模型规模增加实现了mAPtest的持续改进,在端到端评估下extra-large变体达到56.7%的mAP50-95。尽管OBB任务具有更高的输入分辨率和计算需求,YOLO26保持高效推理,中小型模型在GPU上延迟低于5毫秒。表5中的结果表明,YOLO26有效地将其边缘优化、无NMS设计扩展到旋转目标检测,使其非常适用于航空影像和遥感应用。
表5:YOLO26在1024像素分辨率下DOTA v1数据集的定向目标检测(OBB)性能。结果报告端到端(e2e)测试精度、CPU(ONNX)和NVIDIA T4(TensorRT10 FP16)上的推理速度,以及模型大小和FLOPs。
表格
| 模型 | 尺寸(像素) | mAPtest 50-95 (e2e) | mAPtest 50 (e2e) | 速度 CPU ONNX (ms) | 速度 T4 TRT10 (ms) | 参数量 (M) | FLOPs (B) |
|---|---|---|---|---|---|---|---|
| YOLO26n-obb | 1024 | 52.4 | 78.9 | 97.7±0.9 | 2.8±0.0 | 2.5 | 14.0 |
| YOLO26s-obb | 1024 | 54.8 | 80.9 | 218.0±1.4 | 4.9±0.1 | 9.8 | 55.1 |
| YOLO26m-obb | 1024 | 55.3 | 81.0 | 579.2±3.8 | 10.2±0.3 | 21.2 | 183.3 |
| YOLO26l-obb | 1024 | 56.2 | 81.6 | 735.6±3.1 | 13.0±0.2 | 25.6 | 230.0 |
| YOLO26x-obb | 1024 | 56.7 | 81.7 | 1485.7±11.5 | 30.5±0.9 | 57.6 | 516.5 |
4 使用Ultralytics YOLO26进行实时部署
在过去十年中,目标检测模型的演变不仅以精度提高为标志,而且以部署复杂性增加为标志(Trigka and Dritsas, 2025; Hosain et al., 2024; Pravallika et al., 2024)。早期检测器如R-CNN及其更快的变体(Fast R-CNN、Faster R-CNN)实现了令人印象深刻的检测质量,但计算成本高昂,需要多阶段进行区域提议和分类(Tian et al., 2025a; Fu and Wang, 2024; Mohammed, 2025)。这限制了它们在实时和嵌入式应用中的使用。YOLO家族的出现通过将检测重新表述为单一回归问题改变了这一格局,使商品GPU上的实时性能成为可能(Johnson, 2025)。然而,随着YOLO系列从YOLOv1发展到YOLOv13,精度改进往往以额外架构组件为代价,如分布焦点损失(DFL)、复杂的后处理步骤如非极大值抑制(NMS),以及引入部署摩擦的日益沉重的骨干网络。YOLO26通过精简架构和导出路径直接解决了这一长期存在的挑战,从而降低了跨多样硬件和软件生态系统的部署障碍。
4.1 灵活的导出与集成路径
YOLO26的一个关键优势是其与现有生产管道的无缝集成。Ultralytics维护一个积极开发的Python包,为训练、验证和导出提供统一支持,降低了寻求采用YOLO26的从业者的技术门槛。与早期需要广泛自定义转换脚本进行硬件加速的YOLO模型不同(Pestana et al., 2021; Nguyen et al., 2019; Ding et al., 2019),YOLO26原生支持广泛的导出格式。这些包括用于最大GPU加速的TensorRT、用于广泛跨平台兼容性的ONNX、用于原生iOS集成的CoreML、用于Android和边缘设备的TFLite,以及用于Intel硬件优化性能的OpenVINO。这些导出选项的广度使研究人员、工程师和开发人员能够在不遇到前几代常见兼容性瓶颈的情况下,将模型从原型转移到生产。
历史上,YOLOv3到YOLOv7在导出期间通常需要手动干预,特别是当针对NVIDIA TensorRT或Apple CoreML等专业推理引擎时(Kusuma and Soewito, 2023; Surantha and Sutisna, 2025)。类似地,DETR及其后继者等基于Transformer的检测器由于依赖动态注意力机制,在PyTorch环境之外转换时面临挑战。相比之下,YOLO26通过移除DFL和采用无NMS预测头而简化的架构,确保了在不牺牲精度的情况下跨平台兼容性。这使YOLO26成为迄今为止对部署最友好的检测器之一,强化了其作为边缘优先模型的身份。
4.2 量化与资源受限设备
除了导出灵活性之外,真实世界部署的真正挑战在于确保有限计算资源设备上的效率(Hosain et al., 2024; Abdulhaq and Ahmed, 2025)。智能手机、无人机和嵌入式视觉系统等边缘设备通常缺乏独立GPU,必须平衡内存、功耗和延迟限制(Hossain and Lee, 2019; Setyanto et al., 2023)。量化是一种广泛采用的策略,用于减少模型大小和计算负载,但许多复杂检测器在激进量化下经历显著的精度降级。YOLO26在设计时考虑到了这一限制。
由于其精简的架构和简化的边界框回归管道,YOLO26在半精度(FP16)和整型(INT8)量化方案下都表现出一致的精度。FP16量化利用GPU对混合精度算术的原生支持,以 reduced 内存占用实现更快推理。INT8量化将模型权重压缩到8位整数,在保持有竞争力精度的同时,实现了模型大小和能耗的显著降低。基准实验确认YOLO26在这些量化级别上保持稳定性,在相同条件下优于YOLOv11和YOLOv12。这使YOLO26特别适合部署在NVIDIA Jetson Orin、Qualcomm Snapdragon AI加速器或甚至为智能摄像头供电的ARM CPU等紧凑型硬件上。
相比之下,RT-DETRv3等基于Transformer的检测器在INT8量化下表现出性能急剧下降(Wang et al., 2025),主要是由于注意力机制对降低精度的敏感性。类似地,YOLOv12和YOLOv12虽然在GPU服务器上提供强大精度,但一旦量化,在低功耗设备上难以保持有竞争力的性能。因此,YOLO26确立了目标检测中量化感知设计的新基准,证明架构简单性可以直接转化为部署鲁棒性。
4.3 跨行业应用:从机器人到制造
这些部署增强的实际影响最好通过跨行业应用来说明。在机器人领域,实时感知对导航、操作和 safe 人机协作至关重要(Bonci et al., 2021; Sapkota and Karkee, 2026)。通过提供无NMS预测和一致的低延迟推理,YOLO26使机器人系统能够更快更可靠地解释其环境。例如,配备YOLO26的机械臂可以在动态条件下以更高精度识别和抓取物体,而移动机器人在杂乱空间中受益于改进的障碍物识别。与YOLOv8或YOLOv11相比,YOLO26提供 reduced 推理延迟,在高速场景中,这可能是安全操作和碰撞之间的差异。
在制造业,YOLO26对自动化缺陷检测和质量保证具有重大影响。传统的人工检查不仅劳动密集,而且容易出错。以前的YOLO版本,特别是YOLOv8,已部署在智能工厂中;然而,导出的复杂性和NMS的延迟开销有时限制了大规模推广。YOLO26通过OpenVINO或TensorRT提供轻量级部署选项,缓解了这些障碍,允许制造商直接在生产线上集成实时缺陷检测系统。早期基准测试表明,与YOLOv12和DEIM等基于Transformer的替代方案相比,基于YOLO26的缺陷检测管道实现了更高的吞吐量和更低的运营成本。
4.4 YOLO26部署的更广泛见解
总之,YOLO26的部署特征强调了一个中心主题:架构效率与精度同样关键。虽然过去五年见证了日益复杂模型的兴起——从基于卷积的YOLO变体到基于Transformer的检测器如DETR和RT-DETR——但实验室性能与生产就绪性之间的差距往往限制了它们的影响。YOLO26通过简化架构、扩展导出兼容性和确保量化下的弹性来弥合这一差距,从而将尖端精度与实际部署需求对齐。
对于构建移动应用程序的开发人员,YOLO26通过CoreML和TFLite实现无缝集成,确保模型在iOS和Android平台上原生运行。对于在云或本地服务器部署视觉AI的企业,TensorRT和ONNX导出提供可扩展的加速选项。对于工业和边缘用户,OpenVINO和INT8量化保证即使在严格资源约束下性能也保持一致。从这个意义上说,YOLO26不仅是目标检测研究向前的一步,也是部署民主化的重要里程碑。
5 结论与未来方向
总之,YOLO26代表了YOLO目标检测系列的重大飞跃,将架构创新与对部署的务实关注相结合。该模型通过移除分布焦点损失(DFL)模块和消除对非极大值抑制的需求来简化其设计。通过移除DFL,YOLO26简化了边界框回归并避免了导出并发症,这拓宽了与各种硬件的兼容性。同样,其端到端、无NMS推理使网络能够直接输出最终检测结果而无需后处理步骤。这不仅减少了延迟,还简化了部署管道,使YOLO26成为早期YOLO概念的自然演进。在训练中,YOLO26引入了渐进损失平衡(ProgLoss)和小目标感知标签分配(STAL),它们共同稳定学习并提高挑战性小目标的精度。此外,结合SGD和Muon属性的新颖MuSGD优化器加速了收敛并提高了训练稳定性。这些增强协同工作,提供了一个不仅更准确、更鲁棒,而且在实践中明显更快、更轻的检测器。
基准比较强调了YOLO26相对于其YOLO前代和当代模型的强大性能。YOLO11等先前YOLO版本以更高效率超越早期版本,YOLOv12通过集成注意力机制进一步扩展了精度。YOLOv13添加了基于超图的细化以实现额外改进。与基于Transformer的竞争对手相比,YOLO26缩小了大部分差距。其原生无NMS设计反映了受Transformer启发的检测器的端到端方法,但具有YOLO的标志性效率。YOLO26提供有竞争力的精度,同时在通用硬件上显著提升吞吐量并最小化复杂性。事实上,YOLO26的设计使CPU推理速度比先前YOLO版本快达43%,使其成为资源受限环境中最实用的实时检测器之一。这种性能与效率的和谐平衡使YOLO26不仅能在基准排行榜上表现出色,而且能在速度、内存和能源至关重要的实际现场部署中表现出色。
YOLO26的一个主要贡献是其对部署优势的强调。模型的架构被刻意优化以用于真实世界:通过省略DFL和NMS,YOLO26避免了在专用硬件加速器上难以实现的操作,从而提高了跨设备的兼容性。该网络可导出到广泛的格式,包括ONNX、TensorRT、CoreML、TFLite和OpenVINO,确保开发人员可以将其集成到移动应用程序、嵌入式系统或云服务中。至关重要的是,YOLO26还支持鲁棒量化:由于其简化的架构能够容忍低比特推理,它可以以INT8量化或半精度FP16部署,对精度影响最小。这意味着模型可以被压缩和加速,同时仍提供可靠的检测性能。这些特征转化为 real 边缘性能提升——从无人机到智能摄像头,YOLO26可以在CPU和小型设备上实时运行,而先前YOLO模型在这些设备上挣扎。所有这些改进展示了一个总体主题:YOLO26弥合了尖端研究思想与可部署AI解决方案之间的差距。这种方法强调了YOLO26作为学术创新与行业应用之间的桥梁的作用,将最新的视觉进展直接带到从业者手中。
5.1 未来方向
展望未来,YOLO和目标检测研究的轨迹表明了几个有前途的方向。一个明确的途径是将多个视觉任务统一到更整体的模型中。YOLO26已在一个框架中支持目标检测、实例分割、姿态估计、定向边界框和分类,反映了向多任务多功能性的趋势。未来的YOLO迭代可能会通过整合开放词汇和基础模型能力进一步推动这一点。这可能意味着利用强大的视觉-语言模型,使检测器能够以零样本方式识别任意目标类别,而不受固定标签集的限制。通过基于基础模型和大规模预训练,下一代YOLO可以作为通用视觉AI,无缝处理新目标的检测、分割甚至描述。
另一个关键演变可能在目标检测的半监督和自监督学习领域(Tang et al., 2021; Sohn et al., 2020; Huang et al., 2022; Rani et al., 2023)。最先进的检测器仍严重依赖大型标记数据集,但研究正在迅速发展方法以在未标记或部分标记数据上训练。诸如教师-学生训练(Li et al., 2022c; Xu et al., 2021; Mi et al., 2022)、伪标签(Li et al., 2022b; Caine et al., 2021)和自监督特征学习(Jing and Tian, 2020)等技术可以集成到YOLO训练管道中,以减少对广泛人工注释的需求。未来的YOLO可能自动利用大量未注释图像或视频来改进识别鲁棒性。通过这样做,模型可以在无需标记数据比例增加的情况下继续改进其检测能力,使其更能适应新领域或稀有目标类别。
在架构上,我们预期Transformer和CNN设计原则在目标检测器中的持续融合。最近YOLO模型的成功表明,将注意力和全局推理注入YOLO式架构可以产生精度增益(Kang et al., 2024; Vijayakumar and Vairavasundaram, 2024)。未来的YOLO架构可能采用混合设计,结合卷积骨干(用于高效的局部特征提取)与基于Transformer的模块或解码器(用于捕获长程依赖和上下文)。这种混合方法可以通过建模纯CNN或朴素自注意力可能遗漏的关系,改进模型理解复杂场景(例如拥挤或高度上下文环境)的方式。我们期望下一代检测器智能地融合这些技术,实现丰富的特征表征和低延迟。简而言之,“基于CNN”和“基于Transformer”检测器之间的界限将继续模糊,汲取两个世界的精华以处理多样的检测挑战。
最后,随着部署变得越来越关键,未来研究预计将强调从一开始就进行边缘感知训练和优化。模型设计将越来越多地通过量化感知训练、自动化模型压缩和硬件引导架构搜索等技术,与目标平台共同演进。将部署反馈(包括延迟和能耗测量)直接纳入训练循环可能进一步提高真实世界效率。这些方法可以使YOLO模型在运行时约束下动态调整其深度、分辨率或精度,或被蒸馏成具有最小精度损失的紧凑变体。这种边缘优先设计理念对于在IoT、AR/VR和自主系统跨严格资源限制维持实时性能至关重要。