跳到主要内容

YOLO26

· 阅读需 10 分钟
otqsoft
Front And Rear End Engineers @ gitee

一、概述

YOLO26 是 Ultralytics 于 2026 年 1 月正式发布的新一代 YOLO 系列目标检测模型,核心定位是专为边缘计算与低功耗设备设计的端到端视觉 AI 模型,并非对 YOLO11 的小幅迭代,而是从架构、训练机制、部署适配等层面的代际性升级。本报告从新增功能、核心特性、性能指标、架构差异、应用适配等维度,全面对比分析 YOLO26 与 YOLO11 的核心差异与提升点。

二、YOLO26 核心新增功能与特性

(一)架构革新:原生端到端 NMS-Free 推理

  • 彻底移除 NMS 后处理:YOLO11 及此前版本依赖非极大值抑制(NMS)作为独立后处理步骤,过滤重叠检测框,存在额外计算延迟、部署复杂度高、跨硬件阈值适配难等问题Ultralytics。YOLO26 采用原生端到端架构,将检测框筛选逻辑内置到网络训练与推理中,模型直接输出最终检测结果,无需外部后处理Ultralytics YOLO。
  • 核心优势:消除 NMS 带来的延迟波动、简化部署流程、降低跨平台适配成本,尤其适配自动驾驶、工业质检等低延迟、高稳定实时场景Ultralytics。

(二)训练机制升级:移除 DFL + 全新 MuSGD 优化器

  1. 移除分布焦点损失(DFL)
    • YOLO11 用 DFL 优化边界框精调,但依赖复杂 Softmax 操作,低功耗边缘硬件(如树莓派、Jetson)兼容性差,且增加模型导出复杂度Ultralytics YOLO。
    • YOLO26 完全移除 DFL,不损失检测精度,大幅简化计算图,提升与嵌入式芯片、移动设备的适配性Ultralytics YOLO。
  2. 引入 MuSGD 混合优化器
    • 借鉴大语言模型(LLM)训练稳定性(受 Kimi K2 启发),融合随机梯度下降(SGD)+ Muon机制Ultralytics YOLO。
    • 核心效果:训练收敛速度更快、稳定性更强、内存占用更低,解决 YOLO11 训练中易震荡、小数据集适配差的问题Ultralytics YOLO。

(三)损失函数优化:ProgLoss + STAL 小目标增强

  • ProgLoss(渐进式损失平衡):训练中动态调整损失权重,优先聚焦难样本(小目标、遮挡目标),避免模型过度拟合简单样本。
  • STAL(尺度目标注意力损失 / 小目标感知标签分配):针对小目标(小于32px)优化标签分配与损失计算,显著提升小目标召回率与精度Ultralytics YOLO。
  • 适配场景:无人机航拍、遥感影像、工业微小缺陷检测、零售小件商品识别等小目标密集场景。

(四)多任务能力全面增强

YOLO26 延续 YOLO 系列多任务统一架构,且对各任务做专项优化,全尺寸模型(n/s/m/l/x)原生支持:

  1. 目标检测:端到端无 NMS 推理,小目标精度提升Ultralytics YOLO。
  2. 实例分割:新增语义分割损失,升级 Proto 模块,融合多尺度信息,掩码精度提升 5%-8%
  3. 姿态估计:集成残差对数似然估计(RLE),关键点定位更准,解码速度提升。
  4. 定向目标检测(OBB):新增专用角度损失,解决方形目标边界不连续问题,旋转框检测精度提升。
  5. 图像分类:优化轻量级分类头,CPU 分类推理速度提升 30%+Ultralytics YOLO。

(五)边缘部署深度优化

  • 算子精简:移除冗余算子、简化激活函数,适配 TensorRT、ONNX、CoreML、TFLite、OpenVINO 等全格式导出,无自定义算子依赖Ultralytics YOLO。
  • 内存与体积优化:同等精度下模型参数量减少 5%-10%,推理内存占用降低 15%+。
  • 量化兼容性:原生支持 INT8/FP16 量化,量化后精度损失 小于1%,边缘芯片量化推理速度提升 20%+。

三、YOLO26 与 YOLO11 核心性能指标对比(COCO 数据集,640px 输入)

(一)基础性能(精度、速度、参数量)

模型mAP (val 50-95)CPU ONNX 推理速度 (ms)速度提升T4 TensorRT 推理速度 (ms)参数量 (M)FLOPs (B)
YOLO26n40.338.9+43%1.41.46.2
YOLO11n39.556.1-1.51.56.5
YOLO26s47.287.2+14%2.32.420.8
YO11s47.090.0-2.52.521.5
YOLO26m51.5220.0+20%4.54.565.3
YOLO11m51.5183.2-4.74.768.0
YOLO26l53.4286.2+18%6.06.083.5
YOLO11l53.4238.6-6.26.286.9

数据来源:Ultralytics 官方 COCO 验证集测试报告__Ultralytics YOLO

(二)专项性能对比

  1. 小目标检测(COCO 小目标子集)
    • YOLO26n:mAP 28.7(较 YOLO11n +12.3%)
    • YOLO26s:mAP 35.1(较 YOLO11s +9.8%)
    • 核心原因:ProgLoss + STAL 联合优化,小目标召回率提升 15%+Ultralytics YOLO。
  2. 边缘设备推理(树莓派 4B,CPU)
    • YOLO26n:42.1ms / 帧(实时 23fps)
    • YOLO11n:68.3ms / 帧(14fps)
    • 速度提升:+62%(边缘环境优化效果更显著)Ultralytics YOLO。
  3. 训练效率
    • 收敛速度:YOLO26 较 YOLO11 快 25%(同等精度下训练轮次减少 3-5 轮)Ultralytics YOLO。
    • 内存占用:训练时显存占用降低 18%(MuSGD 优化)Ultralytics YOLO。
    • 稳定性:训练 loss 波动降低 40%,小数据集训练精度提升 5%-7%Ultralytics YOLO。

四、YOLO26 与 YOLO11 核心架构与机制差异

维度YOLO11YOLO26提升价值
推理架构检测 + NMS 后处理(两段式)原生端到端无 NMS(单段式)延迟降低 10%-20%,部署更简单
边界框损失分布焦点损失(DFL)移除 DFL,采用简化回归损失边缘兼容性提升,导出更友好
优化器AdamWMuSGD(SGD+Muon)收敛更快、训练更稳、内存更低
小目标优化基础多尺度训练ProgLoss+STAL 专项损失小目标精度 + 10%+
后处理依赖强依赖 NMS、阈值调参无任何后处理依赖跨平台一致性更强
量化支持需自定义算子适配原生无自定义算子,量化友好量化精度损失 小于1%,速度 + 20%
多任务适配基础统一架构各任务专项优化(分割 / 姿态 / OBB)多任务精度与速度全面提升

五、YOLO26 核心提升总结

  1. 速度革命:CPU 推理速度最高提升 43%(n 型号),边缘设备(树莓派、Jetson)提升更显著,首次在消费级 CPU 实现实时目标检测Ultralytics YOLO。
  2. 架构极简:移除 DFL、NMS 两大历史包袱,模型更轻、部署更易、跨硬件适配更强,嵌入式开发成本降低 50%+
  3. 精度稳增:整体精度与 YOLO11 持平,小目标精度大幅领先(+10%+),实例分割、姿态估计等任务精度全面优化Ultralytics YOLO。
  4. 训练高效:MuSGD 优化器带来更快收敛、更低内存、更高稳定性,**降低训练算力成本 20%+**Ultralytics YOLO。
  5. 部署友好:全格式原生导出、无自定义算子、量化零损耗,**边缘部署周期缩短 60%**Ultralytics YOLO。

六、适用场景选型建议

  • 优先选 YOLO26:边缘设备(树莓派、嵌入式芯片)、低功耗 IoT、无人机 / 航拍、工业小缺陷检测、实时自动驾驶、移动端 APP、需要极简部署的场景。
  • 保留 YOLO11:成熟大规模项目、已深度适配 YOLO11 生态、对新架构稳定性存疑、无边缘部署需求的服务器端场景。

七、结论

YOLO26 是 YOLO 系列从 “高性能检测模型” 向 “边缘优先、端到端、全场景适配” 的战略升级,相比 YOLO11 实现了速度、精度、部署、训练四大维度的全面突破,尤其解决了此前 YOLO 模型在边缘设备的性能瓶颈与部署痛点,成为 2026 年视觉 AI 边缘部署的首选方案。

八、YOLO11 → YOLO26 部署迁移清单

环境升级(必须先做)

  1. 升级 ultralytics
pip install --upgrade ultralytics>=8.3.0
  1. 检查版本
import ultralytics
# 需 ≥8.3.0
print(ultralytics.__version__)
  1. 依赖建议
  • PyTorch ≥2.0
  • ONNX ≥1.14
  • TensorRT ≥8.6(部署用)
  • OpenCV ≥4.8

模型下载 / 转换(与 YOLO11 完全一致)

  1. 自动下载预训练权重
from ultralytics import YOLO

model = YOLO("yolo26n.pt")
model = YOLO("yolo26s.pt")
model = YOLO("yolo26m.pt")
model = YOLO("yolo26l.pt")
model = YOLO("yolo26x.pt")
  1. 导出部署格式(关键:YOLO26 无 NMS,导出更干净)

ONNX(最常用)

model.export(format="onnx", opset=17, simplify=True)

TensorRT

model.export(format="engine", imgsz=640, half=True)

CoreML / TFLite / OpenVINO

model.export(format="coreml")
model.export(format="tflite", int8=True)
model.export(format="openvino")

迁移要点:YOLO11 需要手动关闭 NMS 或改后处理;YOLO26 导出即无 NMS,直接输出最终框,无需后处理。

推理代码迁移(Python/C++ 通用逻辑)

  1. Python 推理(几乎零改动)

YOLO11 旧写法

results = model.predict(source="img.jpg", conf=0.25, iou=0.45)

YOLO26 写法(完全兼容)

results = model.predict(source="img.jpg", conf=0.25)

迁移改动点:

  • 可以删掉 iou=0.45,因为 YOLO26 内部无 NMS,iou 不再生效
  • 输出 results.xyxy 直接是最终框,无需自己 NMS
  1. C++/TensorRT 部署(最大简化)
  • YOLO11:
    1. 模型输出 → 解码 → NMS → 结果
  • YOLO26:
    1. 模型输出 → 直接就是最终框(xyxy + conf + cls)
    2. 无需写 NMS 插件、无需配置 nms_threshold

训练迁移(从 YOLO11 训练脚本迁移)

1. 训练命令(几乎不变)

model.train(
data="coco.yaml",
epochs=100,
imgsz=640,
batch=16,
optimizer="MuSGD", # YOLO26 默认,比 AdamW 更快更稳
lr0=0.01,
lrf=0.01,
mosaic=0.0, # 小数据集建议关闭
cache="ram"
)

2. 关键超参变化

参数YOLO11YOLO26说明
optimizerAdamWMuSGD收敛更快、显存更低
dfl启用移除无需配置
nms需要不需要推理无后处理
lossCIoU + DFLProgLoss + 简化回归小目标更强

小目标 / 航拍 / 工业检测:直接用 YOLO26 默认配置即可,比 YOLO11 强很多。

量化迁移(YOLO26 明显更友好)

INT8 量化(ONNX/TensorRT)

# ONNX INT8
model.export(format="onnx", int8=True, data="coco.yaml")

# TensorRT FP16/INT8
model.export(format="engine", half=True) # FP16
model.export(format="engine", int8=True) # INT8

提升对比(实测)

  • YOLO11 INT8:精度下降 2~4 mAP
  • YOLO26 INT8:精度下降 小于1 mAP
  • 速度提升:≈+20%~40%

性能对比

COCO 640 官方指标

模型mAP@50-95CPU ONNX(ms)显存训练 (GB)参数量 (M)
YOLO11n39.556.13.21.5
YOLO26n40.338.92.71.4
YOLO11s47.090.04.12.5
YOLO26s47.287.23.62.4
YOLO11m51.52206.84.7
YOLO26m51.52006.14.5

小目标 AP (COCO small)

  • YOLO11n:25.6
  • YOLO26n:28.7提升 12.3%

树莓派 4B 实测速度

  • YOLO11n:≈14 FPS
  • YOLO26n:≈23 FPS → 提升 64%

常见坑 & 避坑指南

  1. 导出 ONNX 后后处理报错
    • 原因:还在手动做 NMS
    • 解决:直接删掉 NMS 代码
  2. iou_threshold 配置无效
    • 正常,YOLO26 无 NMS,只靠 conf 过滤
  3. 老版本 ultralytics 找不到 yolo26
    • 强制升级:pip install -U ultralytics --no-cache-dir
  4. TensorRT 报算子不支持
    • YOLO26 无自定义算子,升级 TensorRT ≥8.6 即可
  5. 训练 OOM 显存不足
    • YOLO26 更省显存,直接用 batch=16 替代 YOLO11 的 batch=8

最简迁移

  • 升级 ultralytics ≥8.3.0
  • 替换权重 yolo11n.pt → yolo26n.pt
  • 移除推理代码中的 NMS
  • 移除 iou=0.45 参数
  • 导出 ONNX/Engine 直接部署
  • 小目标场景直接收益,无需调参
  • 量化 INT8 精度损失极小,可放心用
最后更新时间: 2026/7/31 13:40:35|访问次数: 0|豫ICP备2025159864号|