GPU
GPU(Graphics Processing Unit)是面向大规模并行计算的通用加速单元,适合运行深度学习框架、计算机视觉模型和大语言模型等计算密集型任务。MTT E300 可通过 M1000 GPU 承载 PyTorch 模型推理、模型训练和大模型服务。
在 MTT E300 上使用 GPU 时,通常基于 MUSA SDK、Torch-MUSA、vLLM-MUSA 等软件栈完成开发和部署。
能力概览
MTT E300 的 GPU 软件栈围绕 PyTorch 生态、大模型推理和模型示例库展开:
- Torch-MUSA:提供 PyTorch 的 MUSA 后端,使 PyTorch 模型可在 MTGPU 上运行、训练、推理和迁移。
- vLLM-MUSA:面向大语言模型推理服务,支持在不同内存规格的 MTT E300 上部署对应规模的 LLM。
- MTGPU Model Zoo:提供基于 MTGPU 和 Torch-MUSA 的模型示例,覆盖图像分类、目标检测、分割模型和其他模型。
- MUSA SDK:提供底层 GPU 编程、计算库、运行时、编译和调试能力,是 Torch-MUSA 与 vLLM-MUSA 的基础软件栈之一。
Torch-MUSA
Torch-MUSA 是摩尔线程为 PyTorch 提供的 MUSA 后端。通过 Torch-MUSA,你可在保持 PyTorch 编程体验的基础上,将模型迁移到 MTGPU 上进行训练或推理。
更多关于环境准备、编译安装、快速入门、算子开发、性能优化、调试工具和代码迁移等完整内容,参见 Torch-MUSA。
vLLM-MUSA 大模型推理
vLLM-MUSA 面向大语言模型推理场景,提供基于 MUSA 的高性能推理框架。你可使用 vLLM-MUSA 在 MTT E300 上部署和运行大模型服务。
MTT E300 不同内存规格适合的模型规模不同:
- 16 GB:适合 7B 以内大语言模型。
- 32 GB:适合 30B 以内大语言模型。
- 64 GB:适合 80B 以内大语言模型。
具体安装、模型准备、服务启动和推理接口说明,参见 vLLM-MUSA-M1000 文档。
MTGPU Model Zoo
m1000_gpu_model_zoo 演示了如何基于 MTGPU 和 Torch-MUSA 进行模型推理加速,帮助你快速验证和部署 AI 模型推理服务。
如果你有新的模型适配,欢迎提交 PR。
- 图像分类
- 目标检测
- 分割模型
- 其他模型
| 模型 | 框架 | 状态 | 链接 | 描述 |
|---|---|---|---|---|
| VIT | PyTorch | ✅ | 🔗 | Google Vision Transformer |
| NSFW | PyTorch | ✅ | 🔗 | NSFW 图像检测(基于 ViT) |
| Gender Classification | PyTorch | ✅ | 🔗 | 性别分类(基于 ViT) |
| SWIN | PyTorch | ✅ | 🔗 | 分类 / 特征骨干网络(ViT) |
| EfficientNet | PyTorch | ✅ | 🔗 | 轻量纯卷积模型(ConvNet) |
| DINO | PyTorch | ✅ | 🔗 | 基于 DINOv2 训练的 ViT |
| CLIP | PyTorch | ✅ | 🔗 | OpenAI CLIP 模型 |
| Chinese-CLIP-ViT | PyTorch | ✅ | 🔗 | 中文 CLIP 模型 |
| AlexNet | ONNX | ✅ | 🔗 | ImageNet 分类 |
| LeNet | ONNX | ✅ | 🔗 | 图像分类 |
| MobileNet-V1 | PyTorch | ✅ | 🔗 | 边缘设备分类、检测、嵌入和分割模型 |
| MobileNet-V3 | PyTorch | ✅ | 🔗 | MobileNet V3 |
| VGG | PyTorch | ✅ | 🔗 | 图像分类 / 特征骨干网络 |
| 模型 | 框架 | 状态 | 链接 | 描述 |
|---|---|---|---|---|
| yolov5 | PyTorch | ✅ | 🔗 | Ultralytics YOLO 目标检测 |
| yolov8 | PyTorch | ✅ | 🔗 | Ultralytics YOLO 目标检测 |
| yolov10 | PyTorch | ✅ | 🔗 | Ultralytics YOLO 目标检测 |
| yolov11 | PyTorch | ✅ | 🔗 | Ultralytics YOLO 目标检测 |
| ADAFACE | PyTorch | ✅ | 🔗 | 人脸识别 CV 模型 |
| EfficientDet-D0 | PyTorch | ✅ | 🔗 | 可扩展的高效目标检测 |
| FasterRCNN | ONNX | 🚧 | 🔗 | 实时目标检测 |
| RetinaFace | PyTorch | ✅ | 🔗 | 单阶段密集人脸定位 |
| SSD MobileNet-V2 | ONNX | ✅ | 🔗 | 现代卷积目标检测速度与精度权衡方案 |
| DETR ResNet50 | PyTorch | ✅ | 🔗 | 基于卷积骨干的编码器-解码器 Transformer |
| 模型 | 框架 | 状态 | 链接 | 描述 |
|---|---|---|---|---|
| SAM2 | PyTorch | ✅ | 🔗 | Segment Anything Model (Transformer) |
| DeepLabV3+ | PyTorch | ✅ | 🔗 | 基于 MobileNetV2 的 DeepLabV3+ |
| FastSAM | ONNX | ✅ | 🔗 | 快速 Segment Anything Model |
| 模型 | 框架 | 状态 | 链接 | 描述 |
|---|---|---|---|---|
| MediaPipe-Hand | ONNX | ✅ | 🔗 | 实时手部检测 |
| PP-OCRv5 | PaddlePaddle | ✅ | 🔗 | PaddleOCR 团队文本检测模型 |
| Unet-Segment | ONNX | ✅ | 🔗 | 实时分割 |
| SuperPoint | PyTorch | ✅ | 🔗 | 兴趣点检测与描述 |
| Mask2Former | PyTorch | ✅ | 🔗 | 通用图像分割 Mask Transformer |
| Cutie | PyTorch | 🚧 | 🔗 | 视频目标分割 |
| GTE Base | PyTorch | 🚧 | 🔗 | GTE 多语言通用文本表示模型 |
| InsightFace | ONNX | ✅ | 🔗 | 人脸分析 |
| Whisper | PyTorch | 🚧 | 🔗 | 自动语音识别(ASR)与语音翻译 |
| Zipformer | ONNX | 🚧 | 🔗 | k2-zipformer-streaming 中英语音识别模型 |
| Wespeaker | ONNX | ✅ | 🔗 | 说话人嵌入学习与验证 |
问题与反馈
如果在开发或者使用 mtgpu_model_zoo 的过程中,遇到任何 bug 或未支持的特性,请向仓库提交 issue。提交 issue 时,请给出复现问题的代码、报错 log,并打上对应标签。

