ONNXRuntime-MUSA-M1000 版本说明
本页只说明 ONNXRuntime-MUSA-M1000 推理软件版本的变化。安装包下载地址与校验信息请以安装与验证为准。
| 版本 | 发布时间 | 说明 | 当前适用范围 |
|---|---|---|---|
| OrtMusaV0.27.7_M1000 | 2026.09.04 | 在 ONNX Runtime MUSA V0.27.7 基础上叠加 M1000 专项优化。 | M1000(MUSA SDK 5.1.0) |
OrtMusaV0.27.7_M1000
本版基于 ONNX Runtime MUSA V0.27.7,针对 M1000 增加了一批专项优化,安装后自动生效,无需修改模型,也无需增加任何开关。
- 注意力与 Transformer:融合注意力与 GEMM 尾巴融合(打包 QKV、SDPA 输入缩放吸收、Gemm 与 Reshape、Gelu 尾巴融合、LayerScale 残差归一化融合),并针对视觉编码器的常见形状做了分块调优。
- 卷积:卷积分块调优;fp16 与 fp32 的 Conv 加 SiLU 融合路径。
- 张量算子向量化:NHWC 最近邻 Resize、末轴小尺寸 fp16 Concat、等分 NHWC Split、
GatherElements索引常驻 device。 - 目标检测:YOLO 框解码后处理融合。
- 依赖变化:Execution Provider 动态库新增一条直接依赖
libmudnn_xmma.so,该库由 muDNN 提供,标准 MUSA SDK 5.1.0 安装即包含。
典型模型的性能
下表是本版重点优化的 9 类计算机视觉模型在 MTT M1000(MUSA SDK 5.1.0)上的实测时延, 单请求串行、单卡独占。
表中数字绑定的是本文档登记的那一份 ONNX 导出,不是一个模型名下的通用值。
同一个模型名在不同来源、不同导出方式下得到的 ONNX 可以相差很大:网络结构与算子写法不同(例如同为 efficientnet_b0,不同实现的 SE 模块会展开成数量差异明显的小算子)、是否把前后处理(如检测的解码与 NMS)一并导出、是否做过图融合与简化。这些差异足以让延迟出现数十个百分点乃至成倍的变化。
因此本表不适合用来与自有模型的实测结果直接比对。请以自研模型在自有工程内的实测为准;如需核对某个具体条目所用的导出方式,请联系摩尔线程技术支持。
| registry ID | 基本结构 / 实际用途 | 输入 shape | fp32 时延 (ms) | fp16 时延 (ms) |
|---|---|---|---|---|
yolo26s | C3k2 + SPPF/C2PSA + anchor-free、NMS-free 端到端检测头;COCO 80 类目标检测 | [1,3,640,640] | 19.624 | 11.954 |
ppocrv5_server_det | DB 文本检测:PPHGNetV2-B4 + LKPAN + PFHeadLocal;只做文本区域检测,不含识别 | [1,3,960,960] | 274.722 | 129.417 |
pp_liteseg_t | STDC1 + SPPM + UAFM + FLD;Cityscapes 19 类实时语义分割 | [1,3,512,1024] | 25.595 | 11.448 |
deeplabv3p_r50_paddle | ResNet50(output-stride 8)+ ASPP + decoder;Cityscapes 19 类语义分割 | [1,3,512,1024] | 161.526 | 136.162 |
deeplabv3_resnet50_tv | ResNet50 + ASPP;VOC 标签集 21 类语义分割 | [1,3,520,520] | 98.927 | 54.949 |
sam3_vision_encoder | ViT patch14 / dim1024 / 32 blocks / 16 heads,含 4 个 global-attention block 与 pyramid neck;为概念提示分割与跟踪提供图像特征 | [1,3,1008,1008] | 3520.943 | 880.972 |
dinov2_base_224 / dinov2_base_518 | ViT-B/14:dim768 / 12 blocks / 12 heads;通用视觉特征骨干,可接分类、检索、深度、分割等下游头。两个条目共用同一份动态分辨率 ONNX | [1,3,224,224][1,3,518,518] | 32.657 148.783 | 12.660 47.234 |
sparse4d_backbone | ResNet-50 + FPN;提取六路环视相机的多尺度图像特征,是 Sparse4D 流水线的第一站 | [1,6,3,256,704] | 319.603 | 58.087 |
sparse4d_head1st / sparse4d_head2nd | Sparse4D 六层检测 decoder。首帧无历史目标状态;后续帧带时序 Instance Bank,额外输出跟踪 ID | 多输入(图像特征 + 900 instance/anchor + 相机标定) | 3890.171 3887.444 | 92.825 92.383 |
已验证模型清单(OrtMusaV0.27.7_M1000)
本清单来自 Model Zoo 的一次全量回归:在 MTT M1000(MUSA SDK 5.1.0)单卡独占环境下, 对全部 105 个登记模型逐个跑 fp32 与 fp16 两档,与 CPU 执行器的 fp32 输出逐输出比对。
本次回归走默认配置,未开启图捕获、NHWC 布局等优化开关, 因此表中延迟为默认配置下的结果,针对具体模型开启这些策略后通常还有进一步优化空间。
本表的延迟同样只对应本文档登记的那一份 ONNX 导出,不适合与自有的同名模型直接比对, 原因见上一节的说明。表中的模型名仅用于标识条目,不代表该名称下的所有导出。
标 ✳ 的档按相对判据判定:这类模型(int8 量化、变长检测头)受自身性质影响, 在任何 GPU 栈上 cosine 都低于绝对阈值,不是引擎的精度问题。
图像分类(38)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
convnext_small | 1×3×224×224 | 1.00000 | 31.91 | 1.00000 | 25.31 |
convnext_tiny | 1×3×224×224 | 1.00000 | 18.70 | 1.00000 | 13.23 |
deit3_small_patch16_224 | 1×3×224×224 | 1.00000 | 13.03 | 1.00000 | 7.45 |
densenet121 | 1×3×224×224 | 1.00000 | 26.00 | 0.99999 | 19.10 |
efficientnet_b0 | 1×3×224×224 | 1.00000 | 11.52 | 0.99996 | 9.17 |
efficientnet_b1 | 1×3×240×240 | 1.00000 | 17.80 | 1.00000 | 13.99 |
efficientnet_b2 | 1×3×288×288 | 1.00000 | 21.82 | 0.99999 | 17.05 |
efficientnet_b3 | 1×3×300×300 | 1.00000 | 29.83 | 1.00000 | 23.32 |
efficientnet_b4 | 1×3×380×380 | 1.00000 | 54.77 | 1.00000 | 41.91 |
eva02_large_patch14_448 | 1×3×448×448 | 1.00000 | 661.80 | 1.00000 | 448.23 |
inception_v3 | 1×3×299×299 | 0.99999 | 22.68 | 0.99999 | 17.45 |
mnasnet1_0 | 1×3×224×224 | 1.00000 | 7.80 | 0.99996 | 6.22 |
mobilenet_v2 | 1×3×224×224 | 1.00000 | 7.91 | 0.99999 | 4.82 |
mobilenet_v3 | 1×3×224×224 | 1.00000 | 24.38 | 0.99998 | 41.14 |
mobilenet_v3_small | 1×3×224×224 | 0.99999 | 20.44 | 0.99998 | 18.96 |
regnet_y_400mf | 1×3×224×224 | 1.00000 | 9.26 | 1.00000 | 8.04 |
resnet101 | 1×3×224×224 | 1.00000 | 31.21 | 1.00000 | 22.39 |
resnet152 | 1×3×224×224 | 1.00000 | 44.21 | 1.00000 | 31.60 |
resnet18 | 1×3×224×224 | 1.00000 | 7.69 | 1.00000 | 5.98 |
resnet34 | 1×3×224×224 | 1.00000 | 14.05 | 1.00000 | 10.65 |
resnet50 | 1×3×224×224 | 1.00000 | 17.16 | 1.00000 | 12.41 |
resnet50-v1-12-int8 | 1×3×224×224 | 1.00000 | 13.61 | — | — |
resnet50-v1-12-qdq | 1×3×224×224 | 0.99986 | 324.31 | — | — |
resnext101_32x8d | 1×3×224×224 | 1.00000 | 46.48 | 1.00000 | 30.29 |
resnext50_32x4d | 1×3×224×224 | 1.00000 | 18.53 | 1.00000 | 13.22 |
shufflenet_v2_x1_0 | 1×3×224×224 | 1.00000 | 5.70 | 0.99998 | 5.36 |
squeezenet1_0 | 1×3×224×224 | 1.00000 | 4.90 | 1.00000 | 4.10 |
squeezenet_v1_1 | 1×3×227×227 | 1.00000 | 4.03 | 1.00000 | 3.32 |
swin_base_patch4_window7_224 | 1×3×224×224 | 1.00000 | 65.40 | 1.00000 | 45.26 |
swin_s3_tiny_224 | 1×3×224×224 | 1.00000 | 21.63 | 0.99999 | 15.33 |
swin_small_patch4_window7_224 | 1×3×224×224 | 1.00000 | 37.02 | 1.00000 | 26.55 |
swin_tiny_patch4_window7_224 | 1×3×224×224 | 1.00000 | 21.33 | 1.00000 | 14.99 |
vgg16 | 1×3×224×224 | 1.00000 | 26.02 | 1.00000 | 15.50 |
vit_base_patch16_224 | 1×3×224×224 | 1.00000 | 25.99 | 1.00000 | 13.54 |
vit_large_patch16_224 | 1×3×224×224 | 1.00000 | 73.89 | 1.00000 | 42.11 |
vit_small_patch16_224 | 1×3×224×224 | 1.00000 | 12.64 | 1.00000 | 7.97 |
vit_tiny_patch16_224 | 1×3×224×224 | 1.00000 | 7.22 | 1.00000 | 4.89 |
wide_resnet50_2 | 1×3×224×224 | 1.00000 | 36.01 | 1.00000 | 25.63 |
目标检测(14)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
FasterRCNN-10 | 3×800×1088 | 1.00000 | 910.27 | † | — |
efficientdet-d0 | 1×3×512×512 | 1.00000 | 72.93 | 1.00000 | 62.52 |
yolo11m | 1×3×640×640 | 1.00000 | 70.53 | 1.00000 | 48.92 |
yolo_v11n | 1×3×640×640 | 1.00000 | 27.21 | 1.00000 | 23.10 |
yolo_v11s | 1×3×640×640 | 1.00000 | 38.01 | 1.00000 | 28.13 |
yolov12n | 1×3×640×640 | 1.00000 | 39.45 | 1.00000 | 31.02 |
yolov12s | 1×3×640×640 | 1.00000 | 57.35 | 1.00000 | 39.85 |
yolov12x | 1×3×640×640 | 1.00000 | 222.55 | 1.00000 | 143.97 |
yolov12x_b4 | 4×3×640×640 | 1.00000 | 493.17 | — | — |
yolov3 | 1×3×416×416 | 1.00000 | 63.31 | 1.00000 | 46.20 |
yolov5s | 1×3×640×640 | 1.00000 | 38.95 | 1.00000 | 31.91 |
yolov8m | 1×3×640×640 | 1.00000 | 66.56 | 1.00000 | 46.27 |
yolov8s | 1×3×640×640 | 1.00000 | 36.07 | 1.00000 | 26.16 |
yowov3 | 1×3×16×224×224 | 1.00000 | 94.58 | 1.00000 | 74.59 |
图像分割(12)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
deeplabv3_resnet50_tv | 1×3×520×520 | 1.00000 | 182.92 | 1.00000 | 120.13 |
deeplabv3p_r50_paddle | 1×3×512×1024 | 1.00000 | 338.10 | — | — |
fastsam_s | 1×3×1024×1024 | 1.00000 | 100.97 | 1.00000 | 67.73 |
musetalk_face_parsing | 1×3×512×512 | 1.00000 | 59.42 | 1.00000 | 47.12 |
pp_liteseg_t | 1×3×512×1024 | 1.00000 | 87.61 | — | — |
sam2_tiny | 1×3×1024×1024 | 1.00000 | 261.11 | 1.00000 | 159.35 |
sam3_vision_encoder | 1×3×1008×1008 | 0.99999 | 3611.17 | 0.99996 | 2149.67 |
segformer_b0 | 1×3×1024×1024 | 1.00000 | 318.57 | — | — |
yolo11m-seg | 1×3×640×640 | 1.00000 | 97.33 | 1.00000 | 66.67 |
yolov5s-seg | 1×3×640×640 | 1.00000 | 53.67 | 1.00000 | 44.22 |
yolov8m-seg | 1×3×640×640 | 1.00000 | 88.16 | 1.00000 | 60.98 |
yolov8s-seg | 1×3×640×640 | 1.00000 | 51.09 | 1.00000 | 37.15 |
语音识别(7)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
musetalk_whisper_encoder | 1×80×3000 | 1.00000 | 50.66 | 1.00000 | 37.32 |
paraformer_zh | 1×200×560 + 1 | 1.00000 | 324.82 | — | — |
sensevoice_small | 1×200×560 + 1 + 1 + 1 | 0.99958 | 1923.12 | — | — |
sherpa_whisper_base | 1×80×3000 | 0.99498 ✳ | 547.23 | — | — |
wav2vec2_base | 1×26880 | 1.00000 | 25.54 | 1.00000 | 15.83 |
zipformer_decoder_en | 1×2 | 1.00000 | 0.65 | 1.00000 | 0.63 |
zipformer_joiner_en | 1×512 + 1×512 | 1.00000 | 0.22 | 1.00000 | 0.25 |
视觉特征 (ViT)(4)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
dinov2_base_224 | 1×3×224×224 | 1.00000 | 36.70 | 0.99981 | 18.91 |
dinov2_base_518 | 1×3×518×518 | 1.00000 | 163.34 | 0.99996 | 62.76 |
dinov3_vitb16_224 | 1×3×224×224 | 1.00000 | 172.80 | 0.99998 | 59.02 |
eva02_large_patch14_224 | 1×3×224×224 | 1.00000 | 192.39 | 1.00000 | 135.28 |
图像生成(3)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
musetalk_vae_decoder | 1×4×32×32 | 1.00000 | 264.83 | 1.00000 | 138.18 |
musetalk_vae_encoder | 1×3×256×256 | 1.00000 | 130.68 | 1.00000 | 69.34 |
sd15_vae_decoder | 1×4×64×64 | 1.00000 | 982.19 | 1.00000 | 490.22 |
姿态估计(3)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
yolo11m-pose | 1×3×640×640 | 1.00000 | 72.54 | 1.00000 | 49.47 |
yolov8m-pose | 1×3×640×640 | 1.00000 | 68.08 | 1.00000 | 46.74 |
yolov8s-pose | 1×3×640×640 | 1.00000 | 37.05 | 1.00000 | 26.17 |
数字人口型驱动(3)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
musetalk_positional_encoding | 1×50×384 | 1.00000 | 0.32 | 1.00000 | 0.34 |
musetalk_unet | 1×8×32×32 + 1×50×384 | 0.99997 | 225.20 | — | — |
wav2lip | 1×1×80×16 + 1×6×96×96 | 1.00000 | 18.36 | 1.00000 | 18.33 |
语音合成(3)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
cosyvoice2_flow_decoder | 2×80×256 + 2×1×256 + 2×80×256 + 2 + 2×80 + 2×80×256 | 1.00000 | 116.48 | 1.00000 | 83.10 |
cosyvoice2_speech_tokenizer | 1×128×256 + 1 | 1.00000 | 23.50 | 1.00000 | 17.08 |
supertonic | 1×32 + 1×50×256 + 1×1×32 | 1.00000 | 18.16 | — | — |
语音活动检测(2)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
fsmn_vad | 1×200×400 + 1×128×19×1 + 1×128×19×1 + 1×128×19×1 + 1×128×19×1 | 1.00000 | 28.63 | — | — |
silero_vad | 1×512 + 动态 + 2×1×64 + 2×1×64 | 1.00000 | 3.04 | — | — |
超分辨率(2)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
sub_pixel_cnn_x3 | 1×1×224×224 | 1.00000 | 8.57 | — | — |
sub_pixel_cnn_x3_b8 | 8×1×224×224 | 1.00000 | 63.47 | — | — |
文本 Embedding(2)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
bge_m3 | 1×8192 + 1×8192 | 1.00000 | 11167.74 | — | — |
jina_embeddings_v3 | 1×512 + 1×512 + 动态 | 1.00000 | 1744.46 | — | — |
声纹识别(2)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
campplus_3dspeaker | 1×200×80 | 0.99998 | 43.13 | — | — |
campplus_cosyvoice | 1×200×80 | 0.99997 | 43.15 | — | — |
音源分离(1)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
migu_mdxnet_inst_hq3 | 1×4×3072×256 | 0.99986 | 529.42 | 0.99985 | 348.73 |
视觉骨干网络(1)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
sparse4d_backbone | 1×6×3×256×704 | 1.00000 | 329.55 | — | — |
视频插帧(1)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
rife_4x | 1×6×256×448 | 1.00000 | 52.93 | 0.97696 ✳ | 44.17 |
OCR 文本检测(1)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
ppocrv5_server_det | 1×3×960×960 | 1.00000 | 340.67 | 0.13304 ✳ | 225.18 |
风格迁移(1)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
fast_style_candy | 1×3×224×224 | 1.00000 | 31.07 | — | — |
文本分类(1)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
relev_bert | 80×114 + 80×114 + 80×114 | 1.00000 | 299.16 | — | — |
文本编码(1)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
gte_base | 1×512 + 1×512 + 1×512 | 1.00000 | 53.35 | 1.00000 | 32.24 |
说话人分离(1)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
pyannote_segmentation_3 | 1×1×160000 | 1.00000 | 58.60 | 1.00000 | 81.35 |
双目深度(1)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
foundation_stereo | 1×3×480×640 + 1×3×480×640 | 1.00000 | 1591.51 | 1.00000 | 1033.28 |
视频镜头分割(1)
| 模型 | 输入尺寸 | fp32 cosine | fp32 延迟 (ms) | fp16 cosine | fp16 延迟 (ms) |
|---|---|---|---|---|---|
transnetv2 | 1×100×27×48×3 | 1.00000 | 107.61 | 1.00000 | 84.51 |

