跳到主要内容

ONNXRuntime-MUSA-M1000 版本说明

本页只说明 ONNXRuntime-MUSA-M1000 推理软件版本的变化。安装包下载地址与校验信息请以安装与验证为准。

版本发布时间说明当前适用范围
OrtMusaV0.27.7_M10002026.09.04在 ONNX Runtime MUSA V0.27.7 基础上叠加 M1000 专项优化。M1000(MUSA SDK 5.1.0)

OrtMusaV0.27.7_M1000

本版基于 ONNX Runtime MUSA V0.27.7,针对 M1000 增加了一批专项优化,安装后自动生效,无需修改模型,也无需增加任何开关。

  • 注意力与 Transformer:融合注意力与 GEMM 尾巴融合(打包 QKV、SDPA 输入缩放吸收、Gemm 与 Reshape、Gelu 尾巴融合、LayerScale 残差归一化融合),并针对视觉编码器的常见形状做了分块调优。
  • 卷积:卷积分块调优;fp16 与 fp32 的 Conv 加 SiLU 融合路径。
  • 张量算子向量化:NHWC 最近邻 Resize、末轴小尺寸 fp16 Concat、等分 NHWC Split、GatherElements 索引常驻 device。
  • 目标检测:YOLO 框解码后处理融合。
  • 依赖变化:Execution Provider 动态库新增一条直接依赖 libmudnn_xmma.so,该库由 muDNN 提供,标准 MUSA SDK 5.1.0 安装即包含。

典型模型的性能

下表是本版重点优化的 9 类计算机视觉模型在 MTT M1000(MUSA SDK 5.1.0)上的实测时延, 单请求串行、单卡独占。

注意

表中数字绑定的是本文档登记的那一份 ONNX 导出,不是一个模型名下的通用值。

同一个模型名在不同来源、不同导出方式下得到的 ONNX 可以相差很大:网络结构与算子写法不同(例如同为 efficientnet_b0,不同实现的 SE 模块会展开成数量差异明显的小算子)、是否把前后处理(如检测的解码与 NMS)一并导出、是否做过图融合与简化。这些差异足以让延迟出现数十个百分点乃至成倍的变化。

因此本表不适合用来与自有模型的实测结果直接比对。请以自研模型在自有工程内的实测为准;如需核对某个具体条目所用的导出方式,请联系摩尔线程技术支持。

registry ID基本结构 / 实际用途输入 shapefp32 时延 (ms)fp16 时延 (ms)
yolo26sC3k2 + SPPF/C2PSA + anchor-free、NMS-free 端到端检测头;COCO 80 类目标检测[1,3,640,640]19.62411.954
ppocrv5_server_detDB 文本检测:PPHGNetV2-B4 + LKPAN + PFHeadLocal;只做文本区域检测,不含识别[1,3,960,960]274.722129.417
pp_liteseg_tSTDC1 + SPPM + UAFM + FLD;Cityscapes 19 类实时语义分割[1,3,512,1024]25.59511.448
deeplabv3p_r50_paddleResNet50(output-stride 8)+ ASPP + decoder;Cityscapes 19 类语义分割[1,3,512,1024]161.526136.162
deeplabv3_resnet50_tvResNet50 + ASPP;VOC 标签集 21 类语义分割[1,3,520,520]98.92754.949
sam3_vision_encoderViT patch14 / dim1024 / 32 blocks / 16 heads,含 4 个 global-attention block 与 pyramid neck;为概念提示分割与跟踪提供图像特征[1,3,1008,1008]3520.943880.972
dinov2_base_224 / dinov2_base_518ViT-B/14:dim768 / 12 blocks / 12 heads;通用视觉特征骨干,可接分类、检索、深度、分割等下游头。两个条目共用同一份动态分辨率 ONNX[1,3,224,224]
[1,3,518,518]
32.657
148.783
12.660
47.234
sparse4d_backboneResNet-50 + FPN;提取六路环视相机的多尺度图像特征,是 Sparse4D 流水线的第一站[1,6,3,256,704]319.60358.087
sparse4d_head1st / sparse4d_head2ndSparse4D 六层检测 decoder。首帧无历史目标状态;后续帧带时序 Instance Bank,额外输出跟踪 ID多输入(图像特征 + 900 instance/anchor + 相机标定)3890.171
3887.444
92.825
92.383

已验证模型清单(OrtMusaV0.27.7_M1000)

本清单来自 Model Zoo 的一次全量回归:在 MTT M1000(MUSA SDK 5.1.0)单卡独占环境下, 对全部 105 个登记模型逐个跑 fp32 与 fp16 两档,与 CPU 执行器的 fp32 输出逐输出比对。

本次回归走默认配置,未开启图捕获、NHWC 布局等优化开关, 因此表中延迟为默认配置下的结果,针对具体模型开启这些策略后通常还有进一步优化空间。

本表的延迟同样只对应本文档登记的那一份 ONNX 导出,不适合与自有的同名模型直接比对, 原因见上一节的说明。表中的模型名仅用于标识条目,不代表该名称下的所有导出。

的档按相对判据判定:这类模型(int8 量化、变长检测头)受自身性质影响, 在任何 GPU 栈上 cosine 都低于绝对阈值,不是引擎的精度问题。

图像分类(38)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
convnext_small1×3×224×2241.0000031.911.0000025.31
convnext_tiny1×3×224×2241.0000018.701.0000013.23
deit3_small_patch16_2241×3×224×2241.0000013.031.000007.45
densenet1211×3×224×2241.0000026.000.9999919.10
efficientnet_b01×3×224×2241.0000011.520.999969.17
efficientnet_b11×3×240×2401.0000017.801.0000013.99
efficientnet_b21×3×288×2881.0000021.820.9999917.05
efficientnet_b31×3×300×3001.0000029.831.0000023.32
efficientnet_b41×3×380×3801.0000054.771.0000041.91
eva02_large_patch14_4481×3×448×4481.00000661.801.00000448.23
inception_v31×3×299×2990.9999922.680.9999917.45
mnasnet1_01×3×224×2241.000007.800.999966.22
mobilenet_v21×3×224×2241.000007.910.999994.82
mobilenet_v31×3×224×2241.0000024.380.9999841.14
mobilenet_v3_small1×3×224×2240.9999920.440.9999818.96
regnet_y_400mf1×3×224×2241.000009.261.000008.04
resnet1011×3×224×2241.0000031.211.0000022.39
resnet1521×3×224×2241.0000044.211.0000031.60
resnet181×3×224×2241.000007.691.000005.98
resnet341×3×224×2241.0000014.051.0000010.65
resnet501×3×224×2241.0000017.161.0000012.41
resnet50-v1-12-int81×3×224×2241.0000013.61
resnet50-v1-12-qdq1×3×224×2240.99986324.31
resnext101_32x8d1×3×224×2241.0000046.481.0000030.29
resnext50_32x4d1×3×224×2241.0000018.531.0000013.22
shufflenet_v2_x1_01×3×224×2241.000005.700.999985.36
squeezenet1_01×3×224×2241.000004.901.000004.10
squeezenet_v1_11×3×227×2271.000004.031.000003.32
swin_base_patch4_window7_2241×3×224×2241.0000065.401.0000045.26
swin_s3_tiny_2241×3×224×2241.0000021.630.9999915.33
swin_small_patch4_window7_2241×3×224×2241.0000037.021.0000026.55
swin_tiny_patch4_window7_2241×3×224×2241.0000021.331.0000014.99
vgg161×3×224×2241.0000026.021.0000015.50
vit_base_patch16_2241×3×224×2241.0000025.991.0000013.54
vit_large_patch16_2241×3×224×2241.0000073.891.0000042.11
vit_small_patch16_2241×3×224×2241.0000012.641.000007.97
vit_tiny_patch16_2241×3×224×2241.000007.221.000004.89
wide_resnet50_21×3×224×2241.0000036.011.0000025.63

目标检测(14)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
FasterRCNN-103×800×10881.00000910.27
efficientdet-d01×3×512×5121.0000072.931.0000062.52
yolo11m1×3×640×6401.0000070.531.0000048.92
yolo_v11n1×3×640×6401.0000027.211.0000023.10
yolo_v11s1×3×640×6401.0000038.011.0000028.13
yolov12n1×3×640×6401.0000039.451.0000031.02
yolov12s1×3×640×6401.0000057.351.0000039.85
yolov12x1×3×640×6401.00000222.551.00000143.97
yolov12x_b44×3×640×6401.00000493.17
yolov31×3×416×4161.0000063.311.0000046.20
yolov5s1×3×640×6401.0000038.951.0000031.91
yolov8m1×3×640×6401.0000066.561.0000046.27
yolov8s1×3×640×6401.0000036.071.0000026.16
yowov31×3×16×224×2241.0000094.581.0000074.59

图像分割(12)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
deeplabv3_resnet50_tv1×3×520×5201.00000182.921.00000120.13
deeplabv3p_r50_paddle1×3×512×10241.00000338.10
fastsam_s1×3×1024×10241.00000100.971.0000067.73
musetalk_face_parsing1×3×512×5121.0000059.421.0000047.12
pp_liteseg_t1×3×512×10241.0000087.61
sam2_tiny1×3×1024×10241.00000261.111.00000159.35
sam3_vision_encoder1×3×1008×10080.999993611.170.999962149.67
segformer_b01×3×1024×10241.00000318.57
yolo11m-seg1×3×640×6401.0000097.331.0000066.67
yolov5s-seg1×3×640×6401.0000053.671.0000044.22
yolov8m-seg1×3×640×6401.0000088.161.0000060.98
yolov8s-seg1×3×640×6401.0000051.091.0000037.15

语音识别(7)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
musetalk_whisper_encoder1×80×30001.0000050.661.0000037.32
paraformer_zh1×200×560 + 11.00000324.82
sensevoice_small1×200×560 + 1 + 1 + 10.999581923.12
sherpa_whisper_base1×80×30000.99498 ✳547.23
wav2vec2_base1×268801.0000025.541.0000015.83
zipformer_decoder_en1×21.000000.651.000000.63
zipformer_joiner_en1×512 + 1×5121.000000.221.000000.25

视觉特征 (ViT)(4)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
dinov2_base_2241×3×224×2241.0000036.700.9998118.91
dinov2_base_5181×3×518×5181.00000163.340.9999662.76
dinov3_vitb16_2241×3×224×2241.00000172.800.9999859.02
eva02_large_patch14_2241×3×224×2241.00000192.391.00000135.28

图像生成(3)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
musetalk_vae_decoder1×4×32×321.00000264.831.00000138.18
musetalk_vae_encoder1×3×256×2561.00000130.681.0000069.34
sd15_vae_decoder1×4×64×641.00000982.191.00000490.22

姿态估计(3)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
yolo11m-pose1×3×640×6401.0000072.541.0000049.47
yolov8m-pose1×3×640×6401.0000068.081.0000046.74
yolov8s-pose1×3×640×6401.0000037.051.0000026.17

数字人口型驱动(3)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
musetalk_positional_encoding1×50×3841.000000.321.000000.34
musetalk_unet1×8×32×32 + 1×50×3840.99997225.20
wav2lip1×1×80×16 + 1×6×96×961.0000018.361.0000018.33

语音合成(3)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
cosyvoice2_flow_decoder2×80×256 + 2×1×256 + 2×80×256 + 2 + 2×80 + 2×80×2561.00000116.481.0000083.10
cosyvoice2_speech_tokenizer1×128×256 + 11.0000023.501.0000017.08
supertonic1×32 + 1×50×256 + 1×1×321.0000018.16

语音活动检测(2)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
fsmn_vad1×200×400 + 1×128×19×1 + 1×128×19×1 + 1×128×19×1 + 1×128×19×11.0000028.63
silero_vad1×512 + 动态 + 2×1×64 + 2×1×641.000003.04

超分辨率(2)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
sub_pixel_cnn_x31×1×224×2241.000008.57
sub_pixel_cnn_x3_b88×1×224×2241.0000063.47

文本 Embedding(2)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
bge_m31×8192 + 1×81921.0000011167.74
jina_embeddings_v31×512 + 1×512 + 动态1.000001744.46

声纹识别(2)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
campplus_3dspeaker1×200×800.9999843.13
campplus_cosyvoice1×200×800.9999743.15

音源分离(1)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
migu_mdxnet_inst_hq31×4×3072×2560.99986529.420.99985348.73

视觉骨干网络(1)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
sparse4d_backbone1×6×3×256×7041.00000329.55

视频插帧(1)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
rife_4x1×6×256×4481.0000052.930.97696 ✳44.17

OCR 文本检测(1)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
ppocrv5_server_det1×3×960×9601.00000340.670.13304 ✳225.18

风格迁移(1)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
fast_style_candy1×3×224×2241.0000031.07

文本分类(1)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
relev_bert80×114 + 80×114 + 80×1141.00000299.16

文本编码(1)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
gte_base1×512 + 1×512 + 1×5121.0000053.351.0000032.24

说话人分离(1)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
pyannote_segmentation_31×1×1600001.0000058.601.0000081.35

双目深度(1)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
foundation_stereo1×3×480×640 + 1×3×480×6401.000001591.511.000001033.28

视频镜头分割(1)

模型输入尺寸fp32 cosinefp32 延迟 (ms)fp16 cosinefp16 延迟 (ms)
transnetv21×100×27×48×31.00000107.611.0000084.51