Skip to main content

产品概述

MTT E300 AI 计算模组是专为嵌入式边缘 AI 应用场景设计的高性能计算平台,面向端侧实时推理、视频智能分析和端云协同部署。模组提供面向整机集成的硬件形态、接口和运行环境,可在 -20℃ 到 +65℃ 的宽温环境下持续稳定运行,并支持端云协同的全栈 AI 架构。

MTT E300 AI 模组与 M1000 SoC

MTT E300 是面向客户交付和集成的 AI 计算模组,M1000 SoC 是模组内部的核心计算芯片。两者的关系如下图所示:

长江 SoC 和 MTT E300

模组规格

MTT E300 模组规格如下:

规格类目E300* 16G/32GE300* 64G
模组规格60mm x 82mm I MXM 314 PIN I 宽温级 -20℃ ~ 65℃ I Up to 45W
CPU 性能8 核全大核 I 单核频率 2.65GHz
AI 融合算力50TOPS INT8 (DENSE) I 12TFLOPS FP16 I 3TFLOPS FP32
GPU 性能TensorCore 总算力 12TFLOPS(FP16) 24TOPS(INT8)@1.5GHz
NPU 性能13.6TOPS(INT8)@1.5GHz * 2 个 Core
统一内存容量16GB I 适合 7B 以内 LLMs;32GB I 适合 30B 以内 LLMs64GB I 适合 80B 以内 LLMs
统一内存带宽LPDDR5 6400MT/s 102.4GB/s I LPDDR5X 7500MT/s 120GB/sLPDDR5X 8533MT/s 136.5GB/s
视频编码1x8K@30fps I 2x4K@60fps I 4x4K@30fps I H.265/H.264/AV1/MJPEG
视频解码2x8K@30fps I 8x4K@30fps I 32x1080P@30fps I H.265/H.264/AV1/MJPEG
Camera ISPYES I Up to 32M I Support HDR
PCIePCIe 5.0 x 14 Lane
网口10/100/1000M Ethernet x 2 I RJ45
显示*DP/eDP 1.4b x 4

M1000 SoC 结构

在 MTT E300 模组内部,M1000 SoC 集成全大核 CPU、全功能 GPU、高能效 NPU 以及 VPU、DPU、ISP、Audio DSP 等多核异构计算单元,可提供高达 50 TOPS 的 INT8 稠密算力,并支持 INT8、FP16、FP32 等多种精度计算。

M1000 SoC 框图

软件架构

架构概览

MTT E300 软件架构概览

生态系统概览

核心特性

MTT E300 软件架构设计遵循以下核心原则:

  1. 充分发挥芯片主要加速器的能力

    包括高性能图形能力、高性能 AI 推理能力、高性能视频编解码能力、高性能 ISP Camera 图像处理能力、多显示器接入和组合能力,以及丰富的音效和音频处理能力。

  2. 稳定可靠

    所有 Release 软件版本均基于 MT Reference Board,通过了 7×24 小时多轮压力测试、reboot 1000+ cycle 测试、Standby 1000+ cycle 测试,以及数百项 IO 和功能测试。

  3. 高安全性

    MTT E300 芯片内置了基于芯片的根密钥、硬件加解密引擎和 TEE。软件支持在 Security EL2 运行 OP-TEE,透过 OP-TEE 提供安全内存、使用硬件根密钥/加解密引擎加密数据、安全存储等功能。此外,还内置了安全启动特性,同时支持客户自行对产品固件签名。

  4. 智能功耗控制

    支持以下智能功耗控制特性:

    • 智能调频调压
    • 动态开关核心
    • 智能超频
    • 超长待机
    • 过温过载保护
    • 客户可定制功耗策略
  5. 丰富的 OS 生态支持

    支持多种操作系统和使用方式:

    • 已适配 Ubuntu 22.04、ROS 2 系统、Android 14 容器和 Windows 虚拟机
    • 即将完成原生 Android 14 系统和银河麒麟 V11 桌面操作系统适配
    • 后续将持续适配统信 OS 及其他国产操作系统
  6. 丰富的行业解决方案

    提供以下行业解决方案:

    • 基于 MT Stream 的多路 Camera 监控方案,方便快速定制开发多路 Camera 的编解码、追踪、识别任务,具备高性能、低延迟的能力
    • 基于本地 LLM 和 RAG 的数字人一体机方案
    • 基于 ROS 2 和 MT LamdaLab 的具身智能解决方案,包括 locomotion、manipulation、navigation 等多种任务场景,提供端云的 sim2real、real2sim 闭环

    更多其他行业的解决方案将持续构建推出。

  7. 开源

    为便于客户和合作伙伴进行定制化产品开发,MTT E300 代码已开源,并持续进行社区维护和升级。目前,除 GPU 核心驱动和底层安全相关的固件尚未完全开源外,整个 MTT E300 软件栈大部分均已开源。

定制开发

MTT E300 支持多种定制开发方式,包括 BSP 定制、驱动定制、应用开发等。

BSP 与驱动架构

BSP 与驱动架构

BSP 和驱动是板级产品定制的主要组成部分。MT 已开源大部分 BSP 和 IO 接口驱动代码,并提供编译这些源码的 SDK 环境。用户可通过修改这些代码进行以下定制开发:

  • 芯片 Pinctrl 的定义
  • 各种外设和 IO 接口的定制
  • 功耗策略的定制
  • 开发基于芯片硬件安全的安全应用
  • 启动界面和图标的定制
  • 根文件系统的定制

定制开发工作流

MTT E300 的定制开发工作流如下:

AI 推理引擎

MTT E300 提供强大的 AI 推理能力,支持 NPU 和 GPU 两种推理方式。

NPU 推理

NPU 推理流程

NPU 软件栈组成如下:

  • NPU MTC: NPU 编译器工具,负责在离线状态下将 ONNX 模型转换为 NPU 支持的 MTNN 格式模型文件,转换过程中可进行量化方式选择。
  • NPU MTNNRT: NPU Runtime 库,提供 C/Python API,用于实现 MTNN 模型的载入和推理加速应用。
  • NPU Unify Driver: NPU 驱动层,包含 UMD 和 KMD,负责调度 NPU 硬件,为 Runtime 库提供支撑。

使用 NPU 完成模型部署的主要步骤如下:

  1. 准备 ONNX 模型(从官网直接获取,或通过其他框架模型转换得到)
  2. 使用 mtc 工具将 ONNX 模型转换为 MTNN 模型
  3. 部署 MTNN 模型(调用 mtnnrt 接口加载 MTNN 模型,使用 NPU 进行推理,并对推理结果进行后续处理)
tip

NPU 也可以通过 TIM-VX 支持 ONNXRT online 推理。

GPU 推理

GPU 推理软件栈

GPU 推理软件栈组成如下:

  • vLLM-MUSA/SGLANG 高性能 LLM 推理框架。
  • Torch-MUSA Torch-MUSA 通过集成 muDNN、TritonMUSA、muBlas、MCCL 等,实现了基于 MTGPU 的 PyTorch 后端;从而使开发者可以直接使用 PyTorch 在 MTGPU 上进行分布式训练或推理,并通过 AOTI + Triton 技术编译加速模型推理性能,方便部署。
  • MUSA SDK MUSA SDK 提供了一套完善、高性能的 GPGPU 计算加速软件栈,提供了一套完整的数学及神经网络加速库,如 muDNN、muBlas、muFFT 等;并通过 musify 技术可以轻松移植 CUDA 代码;同时支持 Triton 语言,方便开发者直接复用现有的或开发新的高性能 Triton Kernel。
  • MUSA Runtime: MUSA 运行时库。

Moore Perf Tools:摩尔线程 MUSA 应用程序性能分析工具

Moore Perf Tools 是摩尔线程推出的低开销 GPU 性能分析工具套件,帮助开发人员深入分析 MUSA 应用程序和 Graphics 应用程序的性能瓶颈,并提供调试与性能优化能力。该工具套件包括面向 Compute 应用程序深度分析的 Moore Perf Compute,以及面向通用应用程序分析的 Moore Perf System。

解决方案

MTT E300 提供多种行业解决方案,帮助客户快速落地 AI 应用。

MTStream

MTStream 视频处理流程

MTStream SDK 是专为 MTT E300 平台设计的高性能多媒体处理软件开发包,通过 GStreamer 插件形式封装底层硬件编解码器和图像处理单元的复杂操作,提供简单易用的插件。

目前支持的硬件形态是 MTT E300 AI 计算模组(MTT E300)。

核心能力

  • 高并发:支持多达 4 路以上 1080P 实时视频同步编解码和 AI 推理
  • 低延迟:针对实时视频流优化,端到端延迟极低
  • 硬件加速:深度集成 MTT E300 的解码、编码、图像处理、NPU/GPU(AI 推理)
  • 插件化架构:基于 GStreamer,可灵活组合解码、推理、OSD、编码等模块
  • 支持 AI 推理:可无缝接入 MTNN 框架进行推理

适用场景

  • 智能视频分析(IVA)、智慧城市监控
  • 云游戏、云桌面视频流处理
  • 边缘 AI 推理前的多媒体数据预处理(对接 MTNN 推理)

具身智能

具身智能架构

围绕具身智能需求,构建端侧仿真部署体系:

  • 基于 MuJoCo 构建端侧仿真验证框架,提供 sim2x 支持,实现一键部署策略
  • 提供面向足式机器人的 3D 导航框架,支持仿真和真机验证
  • 结合空间扫描框架,对环境进行实时网格、碰撞和 costmap 重建,支持策略在云端环境下持续演进

软件发布形式

MTT E300 软件涉及组件众多,发布主要通过 Gitee 提供开源代码,并配合云存储发布部分闭源预编译安装包。