产品白皮书
2023 年 11 月 05 日 v2.0
1. 简介
摩尔线程公司简介
元计算是支撑下一 代互联网应用的通用算力平台。摩尔线程致力于创新面向元计算应用的新一代 GPU,构建融合视觉计算、3D 图形计算、科学计算及人工智能计算的综合计算平台,建立基于云原生 GPU 计算的生态系统,助力驱动数字经济发展。公司研发设计全功能 GPU 芯片及相关产品,支持 3D 高速图形渲染、AI 训练推理加速、超高清视频编解码和高性能科学计算等多种组合工作负载,兼顾算力与算效,能够为中国科技生态合作伙伴提供强大的计算加速能力,广泛赋能数字经济多个领域。
摩尔线程 GPU 芯片和服务器端显卡简介
截至 2022 年 12 月 22 日,摩尔线程已经成功研发并上市两颗 GPU 芯片:“苏堤”和“春晓”,分别于 2022 年 3 月和 2022 年 11 月发布。围绕着两颗 GPU 芯片,摩尔线程打造了三款服务器 GPU 产品,分别是 MTT S2000,MTT S1000 和 MTT S3000。目前两颗芯片和三款 GPU 显卡均已完成量产上市。
摩尔线程“苏堤”
“苏堤“芯片基于摩尔线程第一代 MUSA 架构,具有现代图形渲染、AI 计算加速以及科学计算机物理仿真等功能引擎。是第一款支持 AV1 编解码的 GPU,支持视频云、直播、8K 游戏等智能多媒体应用。
摩尔线程“春 晓”
2022 年 11 月,摩尔线程发布的“春晓”芯片同样基于第一代 MUSA 架构打造,其内部集成了 220 亿个晶体管,内置 MUSA 架构通用计算核心以及张量计算核心,可以支持 FP32、FP16 和 INT8 等计算精度。相较于摩尔线程此前发布的“苏堤”芯片,图形渲染能力平均提升 3 倍、编码能力提升 4 倍、解码能力提升 2 倍,AI 计算平均提升 4 倍,物理仿真性能提升 2.5 倍,同时可节约带宽 30%以上。
MTT S3000
MTT S3000 基于“春晓”芯片,物理形态为全高 3/4 长双槽。做为一款服务器端专用显卡,S3000 采用被动散热方式,整卡功耗 250W,外接供电线为标准 CPU 8pin。显卡的物理接口为 PCIE x16 并具备 PCIe Gen5 x16 的传输速率。在一个全功能的春晓芯片的支持下,S3000 的整体渲染、编解码性能相对于上一代芯片均具备明显的能力提升。目前 S3000 即将进入全面量产阶段,GPU 虚拟化可以最多切分 28 个 vGPU 并发服务于 28 个虚拟机,支持 Windows 10 以及 Windows Server 2019 虚拟机中的 vGPU 驱动程序。vGPU 兼容 DirectX、OpenGL 渲染框架,DXVA 编解码框架并提供 MT DirectStream SDK 进行 GPU 硬件编码。
MTT S1000
MTT S1000 基于“苏堤“芯片,物理形态为半高半长单槽;显卡采用被动散热方式,整卡功耗 75W,无需额外的外部供电线。S1000 内置 一颗“苏堤”芯片,显卡与计算机连接的物理接口为 PCIe x16。目前 S1000 以及处于量产出货状态,摩尔线程的 GPU 虚拟化技术软件已完成产品化发布,将一个物理 GPU 切分成最多 10 个虚拟 GPU(vGPU),并提供 Windows 10 虚拟机中的 vGPU 驱动程序。
摩尔线程 GPU 虚拟化技术简介
虚拟化技术是云服务的基础,摩尔线程 GPU 作为重要的算力,软件开发并提供了 GPU 虚拟化技术,满足数据中心中以 GPU 直通、vGPU 的方式使用 GPU 的需求。摩尔线程通过 PCIe Passthrough 技术支持 GPU 直通,通过软件截获直通的方式开发了 vGPU 驱动,并在底层支持 SR-IOV 方案。整体的软件产品通过 MT vGPU 的软件产品形态提供。虚拟化出来的 vGPU 的功能与物理 GPU 设备形态上完全一致,向上可以支持虚拟机中的业务运行。虚拟化系统的架构图如下图所示

图表 1 摩尔线程 GPU 虚拟化框架示意图
摩尔线程虚拟化方案
摩尔线程基于软件的 GPU 虚拟化方案作为整个云基础架构的关键部分,云端为了硬件的集群化以及渲染节点的抽象化,都需要硬件提供虚拟化技术。常见的 GPU 虚拟化技术包括:GPU 直通、GPU 分块。分别可以将 GPU1 对 1 或者 1 对多的分配给不同的节点,以服务于不同的终端。通过多个节点共享的使用一个 GPU 硬件,服务器能够支持更多路的计算服务。摩尔线程的 GPU 虚拟机化方案,主要由四部分构成:摩尔线程物理 GPU、摩尔线程虚拟化驱动、摩尔线程虚拟 GPU 设备和摩尔线程虚拟 GPU 驱动。摩尔线程全功能 GPU 作为整个虚拟化方案的硬件基础,拥有先进的异构计算架构,融合了通用计算,3D 渲染,超高清视频编解码集 AI 训练推理于高清显示于一体,适用于云、边、端各类应用领域,提供了高效稳定的算力保证。虚拟机中,以通用的虚拟 PCIe 设备方式提供给虚拟机使用 IOMMU( Input–output memory management unit )和 VFIO( Virtual Function I/O )技术,兼容主流的 KVM 虚拟化平台。摩尔线程虚拟化驱动,使主流的操作系统对虚拟化无感知,于在物理机使用操作系统体验一致。
相对于目前虚拟 GPU 只能等分分配显存,摩尔线程的 GPU 切分方式更加多样性,可以按照不同的需求采取非等分的方式切分显存。 根据渲染节点任务的负载,GPU 虚拟化应对应的支持不同负载的 GPU 能力分块。目前市面上的显卡只能支持固定比例的分配,这对于多样化的渲染需求来说是不友好的。摩尔线程的 GPU 灵活切分和动态切分需求能够在服务器不重启的情况下,根据负载的需求对 GPU 资源进行划分,以支持云端纷繁复杂的应用需求,最大化的利用硬件能力。
多种调度算法,适应不同场景。对于 GPU 算力的划分,摩尔线程的虚拟化 GPU 软件,针对于不同需求提供了三种调度方式:优先调度策略、等分时间片调度策略、弹性调度策略。
摩尔线程 GPU 直通
作为标准的 PCIe 设备,摩尔线程的显卡支持 GPU 直通的方式到虚拟机中的使用方式。这种情况下,GPU 的性能保真度可以最大化,而且可以实现了不同操作系统上共享设备的使用方式。
2. 核心功能
摩尔线程 GPU 虚拟化技术
摩尔线程的 GPU 虚拟化技术提供了将一块物理 GPU 切分成多个虚拟 GPU,并发的服务于多路虚拟机负载的能力。在虚拟机操作系统中,摩尔线程提供了 Windows 10 等操作系统的虚拟 GPU 驱动,兼容 DirectX 等渲染框架,DXVA 等编解码框架,加速虚拟机中的显示渲染、视频编解码等核心功能。通过实际的测试表明,使用了摩尔线程的 vGPU 的云桌面能够有效的加速 19 款教育类应用,并且能够在视频播放、视频会议、日常办公等场景显著的降低 CPU 的负载,提高整机性能。
做为主机端的 PCIe 设备和虚拟机端的虚拟化 GPU 设备,摩尔线程的 GPU 依赖于 CPU、操作系统、QEMU-KVM 版本,目前 MT vGPU 已经兼容的环境列表如下:
| 环境项目 | 描述 | 备注 |
|---|---|---|
| CPU | Intel CPU,x86 架构 | VT-x 使能 |
| 操作系统 | 基于 ubuntu, centos 等的 Linux 操作系统 | |
| 操作系统+内核版本 | CentOS 7.5 + 5.10.02 Ubuntu 20.04.1 + 5.4.0-423 CentOS 7.9 + 5.10.384 CentOS 7.6 + 4.18.05 CentOS 7.6 + 4.19.126 OpenEuler 20.03 + 4.19.0 BCLinux-for-Euler-21.10 + 4.19.90 | |
| QEMU | 2.11.2,4.2 及后续新版本 | |
| Windows 操作系统 | Windows 10 1909,Windows 21H2 及后续新版本 Windows Server 2019 |
图表 2 摩尔线程 GPU 虚拟化适配环境
灵活切分技术
传统的 GPU 虚拟化技术只能实现对 GPU 资源的均分,对于使用 vGPU 的虚拟机来说性能需要保持一致,在一些应用场景下不能满足虚拟机灵活分配的需求。摩尔线程针对这一行业痛点,开发并提供了灵活切分技术。从功能上来讲,灵活切分技术是在 GPU 的能力范围之内,提供不等分的 vGPU,满足不同业务负载的需求,同时使云平台对于 GPU 的资源做到更细程度的成本控制与纳管。
vGPU 的切分是按照显存的大小对算力、显存、编解码资源进行分割的,目前在摩尔线程“春晓”GPU 芯片上,灵活切分的范围和 vGPU 的数量如下表所示:
| Type-ID | Type-vRAM | 最大分辨率 | 虚拟显示器数量 | S3000 可用数量 |
|---|---|---|---|---|
| mtgpu-1101 | 1GB | 1920x1080 | 1 | 32 |
| mtgpu-1101 | 1GB | 1920x1080 | 2 | 28 |
| mtgpu-1102 | 2GB | 1920x1080 | 2 | 16 |
| mtgpu-1104 | 4GB | 1920x1080 | 2 | 8 |
| mtgpu-1108 | 8GB | 1920x1080 | 2 | 4 |
| mtgpu-1116 | 16GB | 1920x1080 | 2 | 2 |
| mtgpu-1132 | 32GB | 1920x1080 | 2 | 1 |
图表 3 摩尔线程 vGPU 支持切分类型和对应 vGPU 数量
在单个 GPU 显存的范围之内,用户可根据自己的业务负载程度和期望的负载数量,灵活的自主选择 vGPU 的类型。
动态切分技术
在云端,业务的持续性是关键点之一,传统的 GPU 虚拟化技术为了更改 vGPU 的切分,需要重启主机生效,这对于云端来说是非常不友好的。为了满足这一行业痛点,摩尔线程的 GPU 虚拟化技术支持动态切分。即用户可以根据业务需要随时申请、释放 vGPU 资源,释放出来的 vGPU 资源作为资源池,如果有新的业务负载 需要申请使用,无需重启主机,可以直接从资源池中获取相应资源。

图表 4 动态切分技术示意图
Windows 10 虚拟机支持
Windows 一直是桌面系统的主流操作系统,具备广泛的应用兼容特性,摩尔线程的虚拟机中支持 Windows10 操作系统。目前经过摩尔线程广发测试的版本号包括:Windows 10 1909, Windows 10 21H2 及以后新版本。
Windows10 虚拟机中对于显卡的应用包括混合模式和独显模式,一般的英文表述为 Hybrid Mode(混合模式)和 Virtual Display(独显模式),摩尔线程支持两种模式。在混合模式中,摩尔线程的 vGPU 做为独立显卡使用,在进行应用程序加速时需要服从操作系统的标准。在独显模式中,摩尔线程的 vGPU 提供虚拟显示器功能,并支持常用的系统分辨率;在这种模式下,系统中的软件不用单独设置即可自动加速效果。
支持分辨率列表如下表所示
| 支持分辨率列表 |
|---|
| 800*600 |
| 1024*768 |
| 1152*864 |
| 1280*720 |
| 1280*768 |
| 1280*800 |
| 1280*960 |
| 1280*1024 |
| 1360*768 |
| 1366*768 |
| 1600*900 |
| 1600*1024 |
| 1600*1200 |
| 1680*1050 |
| 1920*1080 |
| 2560*1440 |
| 3840*2160 |
图表 5 摩尔线程 vGPU 支持分辨率列表
渲染能力
Direct X 是 Windows 操作系统的 3D 渲染框架,基于 MTT S1000/MTT S2000 显卡的 vGPU 兼容了 Direct X 的渲染框架,目前可以实现的是对 Direct X 11 的框架兼容,并实现了 Direct X 12 的 3D 加速效果。

图表 6 Windows 操作系统中运行 dxdiag 显示结果
OpenGL 是一款跨平台的渲染引擎,一些软件为了跨平台的支持,底层依赖于 OpenGL。因此在渲染能力方面提供 GPU 硬件支持的 OpenGL 能够有效加速应用的体验,有效节省 CPU 负载。目前,摩尔线程 vGPU 能够支持 Windows OpenGL,如下图所示,使用 Unigine Heaven Benchmark 工具查看对 OpenGL 的支持情况

图表 7 摩尔线程 vGPU 运行 Unigine Heaven OpenGL Benchmark 实例
硬件编解码能力
摩尔线程的 vGPU 通过实现对 Windows 操作系统中 DXVA 2.0 框架的兼容,实现了 GPU 硬件加速编解码。目前支持的编码格式包括:H.264,H.265,支持的解码格式为 H.264,H.265,VP9,AV1 等。
硬件的解码能力目前摩尔线程完全兼容了 PotPlayer、VLC 等播放器,能够硬件解码播放 H.264、H.265、VP9 、AV1 等格式 的视频文件。并且通过对浏览器 Chrome,Edge,360 等兼容,能够实现在浏览器中播放视频时候也使用 GPU 进行硬件解码。
摩尔线程通过 MT Direct StreamSDK 提供对 GPU 编码能力的使用,提供在云端虚拟化环境中信息编码传输的有效方法,详细的介绍可参考官网的介绍:https://developer.mthreads.com/sdk/DS-sdk。
GPU 相关 141 款软件兼容列表
摩尔线程基于通用的云桌面系统,测试了常用的 141 款 GPU 相关应用,其中包括了普通教育类软件、音视频媒体编辑类软件、常用办公软件等。保证了对应用程序的良好兼容性,软件列表请见附录 3。
常用 60 款软件兼容列表
摩尔线程从 GPU 的角度出发,对于常用应用和 GPU 的特殊应用进行了兼容性测试,保证应用程序在基于摩尔线程的 vGPU 上正常运行,软件列表请见附录 1。
服务器兼容列表
服务器兼容列表请见附录 2。
3. GPU 加速关键应用
教育类应用加速实例
随着“新课改”教育政策的推进,越来越多的编程类、展示类的软件进入了中小学的信息化教室中,这些软件以炫酷的显示效果,丰富的交互形式从中小学开始就给同学们带来信息技术能力的提升。众所周知云桌面的一体化部署、中心管理、便捷的维护等特性已经获得目前中小学信息化教室的认可,而大家普遍在使用的是 CPU-Only 的云桌面,这种云桌面情况下显示、渲染系统使用的都是 CPU 模拟的 GPU,“新课改”软件的引入给目前的云桌面带来了很大的性能挑战,表现在显示流畅度不足,交互卡顿,CPU 负载高等。
上述内容的本质原因都在于云桌面缺少 GPU 的加速,摩尔线程可通过 vGPU 对 DirectX 渲染框架的兼容增强系统对于教育类软件的运行能力。
实例 1 展示了分别在 CPU-Only 的云桌面中和带有 MT vGPU 的云桌面同时运行 TELLO EDU 教育软件的场景:

图表 8 摩尔线程 vGPU 加速教育软件 TELLO EDU 运行实例
配置信息和运行结果如下表所示
| 环境信息 | CPU_Only(左) | MT vGPU 1.5GB(右) |
|---|---|---|
| CPU | 4C | 4C |
| MEM | 4GB | 4GB |
| GPU | / | MT vGPU1.5GB |
| DISK | 100GB | 100GB |
| 应用信息 | TELLO EDU | |
| CPU 平均负载 | 100% | 70% |
| 平均 FPS | 11 | 56 |
图表 9 摩尔线程 vGPU 加速 TELLO EDU 系统环境和运行结果
vGPU 增强了 TELLO EDU 渲染能力近 6 倍,而同时又能够降低 CPU 的负载 30%。
实例 2 展示了源码编辑器在分别是 CPU-Only 的云桌面和带有摩尔线程 vGPU 的云桌面中的工作对比情况。除了直接可观察的带有 vGPU 的云桌面的 CPU 负载降低了 27%之外,vGPU 云桌面的例子运行程序实现了音视频同步的流畅体验,相对于 CPU-Only 云桌面中表现的卡顿和音视频脱节的情况,vGPU 带来应用体验的本质升级。详细情况可登录摩尔线程官网查看实际的对比情况。

图表 10 摩尔线程 vGPU 加速教育软件源码编辑器运行实例
配置信息和运行结果如下表所示
| 环境信息 | CPU_Only(左) | MT vGPU 1.5GB(右) |
|---|---|---|
| CPU | 4C | 4C |
| MEM | 4GB | 4GB |
| GPU | / | MT vGPU1.5GB |
| DISK | 100GB | 100GB |
| 应用信息 | 源码编辑器 | |
| CPU 平均负载 | 75% | 48% |
| 性能对比 | 音视频不同步、卡顿 | 音视频同步,流畅体验 |
图表 11 摩尔线程 vGPU 加速源码编辑器系统环境和运行结果