跳到主要内容

产品概述

MTT E300 AI 计算模组是专为嵌入式边缘 AI 应用场景设计的高性能计算平台,面向端侧实时推理、视频智能分析和端云协同部署。模组提供面向整机集成的硬件形态、接口和运行环境,可在 -20℃ 到 +65℃ 的宽温环境下持续稳定运行,并支持端云协同的全栈 AI 架构。

MTT E300 AI 模组与 M1000 SoC​

MTT E300 是面向客户交付和集成的 AI 计算模组,M1000 SoC 是模组内部的核心计算芯片。两者的关系如下图所示:

长江 SoC 和 MTT E300

模组规格​

MTT E300 模组规格如下:

规格类目E300* 16G/32GE300* 64G
模组规格60mm x 82mm I MXM 314 PIN I 宽温级 -20℃ ~ 65℃ I Up to 45W
CPU 性能8 核全大核 I 单核频率 2.65GHz
AI 融合算力50TOPS INT8 (DENSE) I 12TFLOPS FP16 I 3TFLOPS FP32
GPU 性能TensorCore 总算力 12TFLOPS(FP16) 24TOPS(INT8)@1.5GHz
NPU 性能13.6TOPS(INT8)@1.5GHz * 2 个 Core
统一内存容量16GB I 适合 7B 以内 LLMs;32GB I 适合 30B 以内 LLMs64GB I 适合 80B 以内 LLMs
统一内存带宽LPDDR5 6400MT/s 102.4GB/s I LPDDR5X 7500MT/s 120GB/sLPDDR5X 8533MT/s 136.5GB/s
视频编码1x8K@30fps I 2x4K@60fps I 4x4K@30fps I H.265/H.264/AV1/MJPEG
视频解码2x8K@30fps I 8x4K@30fps I 32x1080P@30fps I H.265/H.264/AV1/MJPEG
Camera ISPYES I Up to 32M I Support HDR
PCIePCIe 5.0 x 14 Lane
网口10/100/1000M Ethernet x 2 I RJ45
显示*DP/eDP 1.4b x 4

M1000 SoC 结构​

在 MTT E300 模组内部,M1000 SoC 集成全大核 CPU、全功能 GPU、高能效 NPU 以及 VPU、DPU、ISP、Audio DSP 等多核异构计算单元,可提供高达 50 TOPS 的 INT8 稠密算力,并支持 INT8、FP16、FP32 等多种精度计算。

M1000 SoC 框图

软件架构​

架构概览​

MTT E300 软件架构概览

生态系统概览

核心特性​

MTT E300 软件架构设计遵循以下核心原则:

  1. 充分发挥芯片主要加速器的能力

    包括高性能图形能力、高性能 AI 推理能力、高性能视频编解码能力、高性能 ISP Camera 图像处理能力、多显示器接入和组合能力,以及丰富的音效和音频处理能力。

  2. 稳定可靠

    所有 Release 软件版本均基于 MT Reference Board,通过了 7×24 小时多轮压力测试、reboot 1000+ cycle 测试、Standby 1000+ cycle 测试,以及数百项 IO 和功能测试。

  3. 高安全性

    MTT E300 芯片内置了基于芯片的根密钥、硬件加解密引擎和 TEE。软件支持在 Security EL2 运行 OP-TEE,透过 OP-TEE 提供安全内存、使用硬件根密钥/加解密引擎加密数据、安全存储等功能。此外,还内置了安全启动特性,同时支持客户自行对产品固件签名。

  4. 智能功耗控制

    支持以下智能功耗控制特性:

    • 智能调频调压
    • 动态开关核心
    • 智能超频
    • 超长待机
    • 过温过载保护
    • 客户可定制功耗策略
  5. 丰富的 OS 生态支持

    支持多种操作系统和使用方式:

    • 已适配 Ubuntu 22.04、ROS 2 系统、Android 14 容器和 Windows 虚拟机
    • 即将完成原生 Android 14 系统和银河麒麟 V11 桌面操作系统适配
    • 后续将持续适配统信 OS 及其他国产操作系统
  6. 丰富的行业解决方案

    提供以下行业解决方案:

    • 基于 MT Stream 的多路 Camera 监控方案,方便快速定制开发多路 Camera 的编解码、追踪、识别任务,具备高性能、低延迟的能力
    • 基于本地 LLM 和 RAG 的数字人一体机方案
    • 基于 ROS 2 和 MT LamdaLab 的具身智能解决方案,包括 locomotion、manipulation、navigation 等多种任务场景,提供端云的 sim2real、real2sim 闭环

    更多其他行业的解决方案将持续构建推出。

  7. 开源

    为便于客户和合作伙伴进行定制化产品开发,MTT E300 代码已开源,并持续进行社区维护和升级。目前,除 GPU 核心驱动和底层安全相关的固件尚未完全开源外,整个 MTT E300 软件栈大部分均已开源。

定制开发​

MTT E300 支持多种定制开发方式,包括 BSP 定制、驱动定制、应用开发等。

BSP 与驱动架构​

BSP 与驱动架构

BSP 和驱动是板级产品定制的主要组成部分。MT 已开源大部分 BSP 和 IO 接口驱动代码,并提供编译这些源码的 SDK 环境。用户可通过修改这些代码进行以下定制开发:

  • 芯片 Pinctrl 的定义
  • 各种外设和 IO 接口的定制
  • 功耗策略的定制
  • 开发基于芯片硬件安全的安全应用
  • 启动界面和图标的定制
  • 根文件系统的定制

定制开发工作流​

MTT E300 的定制开发工作流如下:

AI 推理引擎​

MTT E300 提供强大的 AI 推理能力,支持 NPU 和 GPU 两种推理方式。

NPU 推理​

NPU 推理流程

NPU 软件栈组成如下:

  • NPU MTC: NPU 编译器工具,负责在离线状态下将 ONNX 模型转换为 NPU 支持的 MTNN 格式模型文件,转换过程中可进行量化方式选择。
  • NPU MTNNRT: NPU Runtime 库,提供 C/Python API,用于实现 MTNN 模型的载入和推理加速应用。
  • NPU Unify Driver: NPU 驱动层,包含 UMD 和 KMD,负责调度 NPU 硬件,为 Runtime 库提供支撑。

使用 NPU 完成模型部署的主要步骤如下:

  1. 准备 ONNX 模型(从官网直接获取,或通过其他框架模型转换得到)
  2. 使用 mtc 工具将 ONNX 模型转换为 MTNN 模型
  3. 部署 MTNN 模型(调用 mtnnrt 接口加载 MTNN 模型,使用 NPU 进行推理,并对推理结果进行后续处理)
提示

NPU 也可以通过 TIM-VX 支持 ONNXRT online 推理。

GPU 推理​

GPU 推理软件栈

GPU 推理软件栈组成如下:

  • vLLM-MUSA/SGLANG: 高性能 LLM 推理框架。
  • Torch-MUSA: Torch-MUSA 通过集成 muDNN、TritonMUSA、muBlas、MCCL 等,实现了基于 MTGPU 的 PyTorch 后端;从而使开发者可以直接使用 PyTorch 在 MTGPU 上进行分布式训练或推理,并通过 AOTI + Triton 技术编译加速模型推理性能,方便部署。
  • MUSA SDK: MUSA SDK 提供了一套完善、高性能的 GPGPU 计算加速软件栈,提供了一套完整的数学及神经网络加速库,如 muDNN、muBlas、muFFT 等;并通过 musify 技术可以轻松移植 CUDA 代码;同时支持 Triton 语言,方便开发者直接复用现有的或开发新的高性能 Triton Kernel。
  • MUSA Runtime: MUSA 运行时库。

Moore Perf Tools:摩尔线程 MUSA 应用程序性能分析工具​

Moore Perf Tools 是摩尔线程推出的低开销 GPU 性能分析工具套件,帮助开发人员深入分析 MUSA 应用程序和 Graphics 应用程序的性能瓶颈,并提供调试与性能优化能力。该工具套件包括面向 Compute 应用程序深度分析的 Moore Perf Compute,以及面向通用应用程序分析的 Moore Perf System。

解决方案​

MTT E300 提供多种行业解决方案,帮助客户快速落地 AI 应用。

MTStream​

MTStream 视频处理流程

MTStream SDK 是专为 MTT E300 平台设计的高性能多媒体处理软件开发包,通过 GStreamer 插件形式封装底层硬件编解码器和图像处理单元的复杂操作,提供简单易用的插件。

目前支持的硬件形态是 MTT E300 AI 计算模组(MTT E300)。

核心能力​

  • 高并发:支持多达 4 路以上 1080P 实时视频同步编解码和 AI 推理
  • 低延迟:针对实时视频流优化,端到端延迟极低
  • 硬件加速:深度集成 MTT E300 的解码、编码、图像处理、NPU/GPU(AI 推理)
  • 插件化架构:基于 GStreamer,可灵活组合解码、推理、OSD、编码等模块
  • 支持 AI 推理:可无缝接入 MTNN 框架进行推理

适用场景​

  • 智能视频分析(IVA)、智慧城市监控
  • 云游戏、云桌面视频流处理
  • 边缘 AI 推理前的多媒体数据预处理(对接 MTNN 推理)

具身智能​

围绕具身智能需求,构建端侧仿真部署体系:

  • 基于 MuJoCo 构建端侧仿真验证框架,提供 sim2x 支持,实现一键部署策略
  • 提供面向足式机器人的 3D 导航框架,支持仿真和真机验证
  • 结合空间扫描框架,对环境进行实时网格、碰撞和 costmap 重建,支持策略在云端环境下持续演进

软件发布形式​

MTT E300 软件涉及组件众多,发布主要通过 Gitee 提供开源代码,并配合云存储发布部分闭源预编译安装包。