vCenter Serverクラスター内のESXiホストにて2枚の NVIDIA GPUカードを搭載し、「共有パススルー GPU 割り当てポリシー」を「複数の仮想マシンにわたって仮想マシンを分散(ベストパフォーマンス)」に設定している環境において、仮想マシン数が奇数の場合、GPU リソースが均等に分散されていないように見えます。
VMware vSphere ESXi 8.0
複数の物理 NVIDIA GPU を搭載
ESXiホスト上で稼働している仮想マシンの総数が「奇数」である場合、2枚の物理 GPU へ仮想マシンを完全に同数で配置することはできません。可能な限り均等に分散配置した結果として、配置される仮想マシン数に「1台」の差が生じます。この1台分のリソース(プロファイルサイズ)差が、GPU メモリ使用率の差異として表れます。
この動作は想定された仕様であり、設定された「複数の仮想マシンにわたって仮想マシンを分散(ベストパフォーマンス)」の分散アルゴリズムは正常に機能しています。
システムに異常や設定の不備はないため、事象に対するトラブルシューティングや設定変更等の対処は不要です。
仮想マシンの総数が「偶数」となった場合は、両 GPU に均等に仮想マシンが配置され、リソースの使用状況も同等になることが確認できます。 分散配置が正常に行われているかは、ESXi ホスト上で以下のコマンドを実行することで確認が可能です。
nvidia-smi コマンドを実行し、各GPUで稼働している仮想マシンプロセスの配置数を確認します。#nvidia-smi
+---------------------------------------------------------------------------------------+
| NVIDIA-SMI 535.261.04 Driver Version: 535.261.04 CUDA Version: N/A |
|-----------------------------------------+----------------------+----------------------+
| GPU Name Persistence-M | Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap | Memory-Usage | GPU-Util Compute M. |
| | | MIG M. |
|=========================================+======================+======================|
| 0 Tesla T4 On | 00000000:##:00.0 Off | Off |
| N/A 47C P8 16W / 70W | 16224MiB / 16384MiB | 2% Default |
| | | N/A |
+-----------------------------------------+----------------------+----------------------+
| 1 Tesla T4 On | 00000000:##:00.0 Off | Off |
| N/A 42C P8 15W / 70W | 12191MiB / 16384MiB | 0% Default |
| | | N/A |
+-----------------------------------------+----------------------+----------------------+
+---------------------------------------------------------------------------------------+
| Processes: |
| GPU GI CI PID Type Process name GPU Memory |
| ID ID Usage |
|=======================================================================================|
| 0 N/A N/A 4987093 C+G ####### 4032MiB |
| 0 N/A N/A 5034942 C+G ####### 4032MiB |
| 0 N/A N/A 5098962 C+G ####### 4032MiB |
| 0 N/A N/A 5110124 C+G ####### 4032MiB |
| 1 N/A N/A 5037855 C+G ####### 4032MiB |
| 1 N/A N/A 5106344 C+G ####### 4032MiB |
| 1 N/A N/A 5299129 C+G ####### 4032MiB |
+---------------------------------------------------------------------------------------+
-> GPU 0 に仮想マシン4台 GPU 1に仮想マシン3台使用していることがわかります。
"localcli graphics device list" コマンドを実行し、各 GPU デバイスごとの "Number of VMs" を確認します。仮想マシン総数が奇数の場合、これらの値に1台の差がある状態が正常です。#localcli graphics device list
0000:##:00.0:
Vendor Name: NVIDIA Corporation
Device Name: Tesla T4
Module Name: nvidia
Graphics Type: SharedPassthru SameSize
Memory Size in KB: 16777216
Number of VMs: 4 <---
0000:##:00.0:
Vendor Name: NVIDIA Corporation
Device Name: Tesla T4
Module Name: nvidia
Graphics Type: SharedPassthru SameSize
Memory Size in KB: 16777216
Number of VMs: 3 <---