版本:下一个
HAMi 支持的设备
下表列出了 HAMi 支持的设备。本表反映的是 HAMi 最新发布版本 v2.10.0。
| 设备类型 | 制造商 | 支持型号 | 状态 | 显存隔离 | 核心隔离 | 多卡支持 |
|---|---|---|---|---|---|---|
| GPU | 英伟达(NVIDIA) | 全系列 | 稳定 | 是 | 是 | 是 |
| MLU | 寒武纪(Cambricon) | 370、590 | 稳定 | 是 | 是 | 否 |
| DCU | 海光(Hygon) | 全系列 | 稳定 | 是 | 是 | 否 |
| NPU | 华为昇腾(Huawei Ascend) | 910B、910B3、910C、310P | 稳定 | 是 | 是 | 否 |
| GPU | 天数智芯(Iluvatar) | 全部 | 稳定 | 是 | 是 | 否 |
| GPU | 摩尔线程(Mthreads) | MTT S4000 | 稳定 | 是 | 是 | 否 |
| GPU | 沐曦(MetaX) | MXC500 | 稳定 | 是 | 是 | 否 |
| GCU | 燧原科技(Enflame) | S60 | 稳定 | 是 | 是 | 否 |
| XPU | 昆仑芯(Kunlunxin) | P800 | 稳定 | 是 | 否 | 否 |
| GPU | 瀚博(Vastai) | VA16 | 稳定 | 否 | 否 | 否 |
| GPU | AMD | Instinct / ROCm | 稳定 | 是 | 是 | 否 |
| Neuron | AWS | Inf、Trn | 稳定 | 否 | 是 | 是 |
| GPU | 壁仞(Biren) | Biren166M | 稳定 | 否 | 否 | 否 |
| DPU | 太初元碁(Teco) | 检查中 | 验证中 | 否 | 否 | 否 |
支持状态:
- 稳定(Stable) - 已在最新发布版本中提供。
- 实验性(Experimental) - 已在 HAMi 中实现,但尚未包含在正式发布版本中。
- 验证中(Under Validation) - 支持仍在实现中,尚不可用。
能力列:
- 显存隔离 - 是否为每个容器强制执行显存硬限制:超出请求显存的工作负载会被拒绝,而不能使用整块物理设备显存。
- 核心隔离 - 是否为每个容器强制执行算力硬限制:内核执行会被限流以保持在请求的份额内,而不能自由使用物理设备的算力。
- 多卡支持 - 单个 Pod 是否可以请求并调度到该类型的多张物理卡,由 HAMi 协调所选卡之间的分配。
各组件分别支持哪些设备
HAMi 只是使用这些设备的四种方式之一。另外三种自行完成调度,隔离部分依赖 HAMi-core。
每个单元格链接到该设备与该组件对应的指南。短横线表示目前没有对应指南,并不代表该组合不可行。
| 制造商 | HAMi | HAMi-DRA | Volcano | KAI-scheduler |
|---|---|---|---|---|
| 英伟达(NVIDIA) | 分配设备显存 | 动态资源分配 | 使用 Volcano vGPU | 使用 KAI Scheduler |
| 寒武纪(Cambricon) | 启用寒武纪 MLU 共享 | - | - | - |
| 海光(Hygon) | 启用海光 DCU 共享 | - | - | - |
| 华为昇腾(Huawei Ascend) | 启用昇腾共享 | - | Volcano 昇腾 vNPU | - |
| 天数智芯(Iluvatar) | 启用天数 GPU 共享 | - | - | - |
| 摩尔线程(Mthreads) | 启用摩尔线程 GPU 共享 | - | - | - |
| 沐曦(MetaX) | 启用沐曦 GPU 共享 | - | - | - |
| 燧原科技(Enflame) | 启用燧原 GCU 共享 | - | - | - |
| 昆仑芯(Kunlunxin) | 启用昆仑芯调度 | - | - | - |
| 瀚博(Vastai) | 启用瀚博设备共享 | - | - | - |
| AMD | 启用 AMD GPU 共享 | - | - | - |
| AWS | 管理 AWS Neuron 设备 | - | - | - |
| 壁仞(Biren) | 启用壁仞设备共享 | - | - | - |
| 太初元碁(Teco) | - | - | - | - |
每份指南都包含该设备的具体搭建步骤、配置说明以及已知限制,部署该设备前请先查阅。
每个厂商的全部页面
下面按厂商列出所有页面,方便从本页直达。
英伟达(NVIDIA)
- 为容器分配设备显存
- 动态资源分配
- 启用动态 MIG 功能
- 调度策略
- 分配设备核心给容器
- 分配到特定设备类型
- 分配到特定设备
- 为 NVIDIA 设备使用扩展的 resourcequota
- 使用独占 GPU
- 为容器分配特定设备显存
- 按百分比分配设备显存给容器
- 为容器分配设备核心资源
- 分配任务到特定类型
- 将任务分配给特定的 GPU
- 将任务分配给 MIG 实例
寒武纪(Cambricon)
海光(Hygon)
摩尔线程(Mthreads)
天数智芯(Iluvatar)
燧原科技(Enflame)
AMD
AWS Neuron
瀚博(Vastai)
壁仞(Biren)
昆仑芯(Kunlunxin)
沐曦(MetaX)
- 启用沐曦 GPU 共享
- 为容器分配设备核心和显存资源
- 分配独占设备
- 分配特定 Qos Policy 的设备
- 启用沐曦 GPU 拓扑感知调度
- Binpack 调度策略
- 扩展调度策略
- 分配沐曦设备
- 使用 binpack 调度策略分配沐曦设备
- 使用扩展调度策略分配沐曦设备