GPU
GPU(Graphics Processing Unit)是面向大规模并行计算的通用加速单元,适合运行深度学习框架、计算机视觉模型和大语言模型等计算密集型任务。MTT E300 可通过 M1000 GPU 承载 PyTorch 模型推理、模型训练和 大模型服务。
在 MTT E300 上使用 GPU 时,通常基于 MUSA SDK、Torch-MUSA、vLLM-MUSA 等软件栈完成开发和部署。
能力概览
MTT E300 的 GPU 软件栈围绕 PyTorch 生态、大模型推理和模型示例库展开:
- Torch-MUSA:提供 PyTorch 的 MUSA 后端,使 PyTorch 模型可在 MTGPU 上运行、训练、推理和迁移。
- vLLM-MUSA:面向大语言模型推理服务,支持在不同内存规格的 MTT E300 上部署对应规模的 LLM。
- MTGPU Model Zoo:提供基于 MTGPU 和 Torch-MUSA 的模型示例,覆盖图像分类、目标检测、分割模型和其他模型。
- MUSA SDK:提供底层 GPU 编程、计算库、运行时、编译和调试能力,是 Torch-MUSA 与 vLLM-MUSA 的基础软件栈之一。
Torch-MUSA
Torch-MUSA 是摩尔线程为 PyTorch 提供的 MUSA 后端。通过 Torch-MUSA,你可在保持 PyTorch 编程体验的基础上,将模型迁移到 MTGPU 上进行训练或推理。
更多关于环境准备、编译安装、快速入门、算子开发、性能优化、调试工具和代码迁移等完整内容,参见 Torch-MUSA。
vLLM-MUSA 大模型推理
vLLM-MUSA 面向大语言模型推理场景,提供基于 MUSA 的高性能推理框架。你可使用 vLLM-MUSA 在 MTT E300 上部署和运行大模型服务。
MTT E300 不同内存规格适合的模型规模不同:
- 16 GB:适合 7B 以内大语言模型。
- 32 GB:适合 30B 以内大语言模型。
- 64 GB:适合 80B 以内大语言模型。
具体安装、模型准备、服务启动和推理接口说明,参见 vLLM-MUSA-M1000 文档。
MTGPU Model Zoo
m1000_gpu_model_zoo 演示了如何基于 MTGPU 和 Torch-MUSA 进行模型推理加速,帮助你快速验证和部署 AI 模型推理服务。
如果你有新的模型适配,欢迎提交 PR。
下表性能取自 M1000 1.5 GHz 性能基准,测试采用 Performance 功耗模式;表中数值为各推理模式的最佳结果,单位为 fps。— 表示该基准暂未提供对应模型的数据。
- 图像分类
- 目标检测
- 分割模型
- 其他模型
| 模型 | 框架 | 状态 | 链接 | 描述 | 最佳性能(fps) |
|---|---|---|---|---|---|
| VIT | PyTorch | ✅ | 🔗 | Google Vision Transformer | 104.71 |
| DeiT | PyTorch | ✅ | 🔗 | 数据高效训练的 Vision Transformer | 103.84 |
| NSFW | PyTorch | ✅ | 🔗 | NSFW 图像检测(基于 ViT) | 102.04 |
| Gender Classification | PyTorch | ✅ | 🔗 | 性别分类(基于 ViT) | 102.25 |
| SWIN | PyTorch | ✅ | 🔗 | 分类 / 特征骨干网络(ViT) | 111.98 |
| EfficientNet | PyTorch | ✅ | 🔗 | 轻量纯卷积模型(ConvNet) | 145.14 |
| DINO | PyTorch | ✅ | 🔗 | 基于 DINOv2 训练的 ViT | 62.42 |
| CLIP | PyTorch | ✅ | 🔗 | OpenAI CLIP 模型 | 17.96 |
| Chinese-CLIP-ViT | PyTorch | ✅ | 🔗 | 中文 CLIP 模型 | 66.09 |
| AlexNet | ONNX | ✅ | 🔗 | ImageNet 分类 | 500.00 |
| LeNet | ONNX | ✅ | 🔗 | 图像分类 | 3846.15 |
| MobileNet-V1 | PyTorch | ✅ | 🔗 | 边缘设备分类、检测、嵌入和分割模型 | 523.56 |
| MobileNet-V3 | PyTorch | ✅ | 🔗 | MobileNet V3 | 591.72 |
| VGG | PyTorch | ✅ | 🔗 | 图像分类 / 特征骨干网络 | 82.03 |
| 模型 | 框架 | 状态 | 链接 | 描述 | 最佳性能(fps) |
|---|---|---|---|---|---|
| yolov5 | PyTorch | ✅ | 🔗 | Ultralytics YOLO 目标检测 | yolov5s:124.07 |
| yolov8 | PyTorch | ✅ | 🔗 | Ultralytics YOLO 目标检测 | yolov8s:94.34 yolov8s-pose:87.34 yolov8m:48.31 yolov8m-pose:46.04 |
| yolov10 | PyTorch | ✅ | 🔗 | Ultralytics YOLO 目标检测 | — |
| yolov11 | PyTorch | ✅ | 🔗 | Ultralytics YOLO 目标检测 | yolo11m:47.73 yolo11m-pose:45.41 |
| yolov26 | PyTorch | ✅ | 🔗 | Ultralytics YOLO 目标检测 | yolo26s:86.13 |
| ADAFACE | PyTorch | ✅ | 🔗 | 人脸识别 CV 模型 | 91.24 |
| EfficientDet-D0 | PyTorch | ✅ | 🔗 | 可扩展的高效目标检测 | 88.11 |
| FasterRCNN | ONNX | 🚧 | 🔗 | 实时目标检测 | — |
| RetinaFace | PyTorch | ✅ | 🔗 | 单阶段密集人脸定位 | 39.59 |
| SSD MobileNet-V2 | ONNX | ✅ | 🔗 | 现代卷积目标检测速度与精度权衡方案 | 188.68 |
| DETR ResNet50 | PyTorch | ✅ | 🔗 | 基于卷积骨干的编码器-解码器 Transformer | 16.66 |
| 模型 | 框架 | 状态 | 链接 | 描述 | 最佳性能(fps) |
|---|---|---|---|---|---|
| SAM2 | PyTorch | ✅ | 🔗 | Segment Anything Model (Transformer) | 9.87(sam2-tiny) |
| DeepLabV3+ | PyTorch | ✅ | 🔗 | 基于 MobileNetV2 的 DeepLabV3+ | 58.58 |
| FastSAM | ONNX | ✅ | 🔗 | 快速 Segment Anything Model | 78.37 |
| yolov5-seg | PyTorch | ✅ | 🔗 | Ultralytics YOLO 图像分割 | yolov5s-seg:99.90 |
| yolov8-seg | PyTorch | ✅ | 🔗 | Ultralytics YOLO 图像分割 | yolov8s-seg:74.63 yolov8m-seg:38.14 |
| yolov11-seg | PyTorch | ✅ | 🔗 | Ultralytics YOLO 图像分割 | yolo11m-seg:35.08 |
| 模型 | 框架 | 状态 | 链接 | 描述 | 最佳性能(fps) |
|---|---|---|---|---|---|
| MediaPipe-Hand | ONNX | ✅ | 🔗 | 实时手部检测 | 225.73 |
| PP-OCRv5 | PaddlePaddle | ✅ | 🔗 | PaddleOCR 团队文本检测模型 | 51.81 |
| Unet-Segment | ONNX | ✅ | 🔗 | 实时分割 | 5.79 |
| SuperPoint | PyTorch | ✅ | 🔗 | 兴趣点检测与描述 | 81.10 |
| Mask2Former | PyTorch | ✅ | 🔗 | 通用图像分割 Mask Transformer | 8.79 |
| LightStereo-S | ONNX | ✅ | 🔗 | 双目立体匹配模型 | 60.57 |
| Cutie | PyTorch | 🚧 | 🔗 | 视频目标分割 | — |
| GTE Base | PyTorch | 🚧 | 🔗 | GTE 多语言通用文本表示模型 | 144.30 |
| InsightFace | ONNX | ✅ | 🔗 | 人脸分析 | 203.25 |
| Whisper | PyTorch | 🚧 | 🔗 | 自动语音识别(ASR)与语音翻译 | 3.38 |
| Zipformer | ONNX | 🚧 | 🔗 | k2-zipformer-streaming 中英语音识别模型 | — |
| Wespeaker | ONNX | ✅ | 🔗 | 说话人嵌入学习与验证 | 194.17 |
问题与反馈
如果在开发或者使用 mtgpu_model_zoo 的过程中,遇到任何 bug 或未支持的特性,请向仓库提交 issue。提交 issue 时,请给出复现问题的代码、报错 log,并打上对应标签。

