ディスク障害を検出した後、vSAN ディスクグループや、ディスクの削除が行えません
search cancel

ディスク障害を検出した後、vSAN ディスクグループや、ディスクの削除が行えません

book

Article ID: 448171

calendar_today

Updated On:

Products

VMware vSAN

Issue/Introduction

免責事項:これは英文の記事「Cannot delete a vSAN disk group or remove the disk after detecting it as faulty」の日本語訳です。
記事はベストエフォートで翻訳を進めているため、ローカライズ化コンテンツは最新情報ではない可能性があります。最新情報は英語版の記事で参照してください。

症状:

  • ディスク障害の発生後、ディスクまたはディスク グループを削除できません。

  • Skyline Health で「操作の健全性(Operation health)」のアラートが表示されます。

    手順: vSAN クラスタを選択 > [監視(Monitor)] > [Skyline Health] > [操作の健全性(Operation Health)] へ移動します。

  • ディスクグループ削除時のエラーメッセージ:

    General vSAN error. vSAN disk data evacuation resource check has failed for disk or disk-group naa.58c###### (527c3109-####-####-####-########) with mode noAction on host hostname.com. Go to vSAN Data Migration Pre-Check page for more details.

  • ディスク削除時のエラーメッセージ:

    A general system error occurred: Failed to decommission disk naa.50#######: Failed to update diskState metadata for disk naa.5050####### with exception: Failed to write partition.

  • UI 上でディスクグループがマウントされていることもあれば、マウントされていない場合もあります。また、以下の警告が記録される場合もあります:

    Disk(s) 52a5e6e0-####-####-####-########, 52299652-####-####-####-########, 52108e7e-####-####-####-########, 52a8efb7-####-####-####-########, 527eee1c-####-####-####-######## are unmounted, but are part of a mounted disk group.

  • ディスクグループを手動で削除しようとすると、以下のエラーで失敗する場合があります:

    Unable to remove device: Failed to get VsanInfo operation lock for diskOpLock, an operation is currently in progress(locked pid: 0), error: /tmp/.vsanDiskOpLock.lock.LOCK: timeout waiting for lock after 30 seconds. Lock is currently held by process 2167523 (vsanesxcmd: /usr/lib/vmware/vsan/bin/vsanesxcmd storage diskgroup mount -s naa.58ce#####)
    Unable to remove device: Disk naa.58ce##### is not writable: Failed to write partition

  • パーティションの読み取りを試行すると、以下のエラーで失敗する場合があります:

    Error: Could not stat device /vmfs/devices/disks//vmfs/devices/disks/naa.58ce##### - No such file or directory.
    Unable to get device /vmfs/devices/disks//vmfs/devices/disks/naa.58ce#####

Environment

VMware vSAN 7.x
VMware vSAN 8.x

Cause

  • ESXiホスト上でディスクは認識(表示)されているものの、通信ができない状態でディスク障害が発生しています。

  • /var/run/log/vmkernel.log に、以下のようなログ エントリが表示される場合があります。

    YYYY-MM-DDTHH:MM:SSZ cpu4:2098069) ScsiDeviceIO: 4176: Cmd (0x45b9fc931fc6) 0x65, CmdSN Ox1352 from world 2102614 to dev "naa.50#######" failed H:0x0 D:0x2 P:0x0 Valid sense data: 0x7 0x27 0x0

    • このセンスコード 0x7 0x27 は次の意味を示します。

      [0x7] --> DATA PROTECT (データ保護)

      27/00 --> WRITE PROTECTED (書き込み禁止)

    • これは vSAN が該当デバイスに書き込めない状態であることを意味します。

  • また、以下のホスト ログ /var/run/log/vmkernel.log のように、ディスクにMedium Errorが発生していることが確認できる場合もあります。

    YYYY-MM-DDTHH:MM:SS.SSSZ In(182) vmkernel: cpu88:2098812) ScsiDeviceIO: 4686: Cmd (0x45df8dec7e80) 0x28, CmdSN 0x8989ca4 from world 0 to dev "naa. #######" failed H:0x0 D: 0x2 P: 0x0 Valid sense data: 0x3 0x11 0x1 Medium Error, LBA: 1038451712

    • この状態でも、vSphere Client からディスクを削除することができない場合があります。

  • 並行して、/var/run/log/vobd.log に以下のログ エントリが出力されます。

    YYYY-MM-DDTHH:MM:SSZ In(14) vobd[2097762]:  [vSANCorrelator] 6114756719521us: [vob.vsan.lsom.metadataURE] vSAN device 5269a55d-####-####-####-######## encountered unrecoverable read error. This disk will be evacuated and rebuilt. If the device is part of a dedup disk group, the entire disk group will be evacuated and rebuilt.

    YYYY-MM-DDTHH:MM:SSZ In(14) vobd[2097762]:  [vSANCorrelator] 6114791656665us: [esx.problem.vob.vsan.lsom.metadataURE] Device 5269a55d-####-####-####-######## encountered an unrecoverable read error. It is in an unhealthy state and will get evacuated and rebuilt. If this device is part of a dedup diskgroup, the entire disk group will be evacuated and rebuilt.

    YYYY-MM-DDTHH:MM:SSZ In(14) vobd[2097762]:  [vSANCorrelator] 6114791656785us: [esx.problem.vob.vsan.lsom.diskunhealthy] vSAN device 5269a55d-####-####-####-######## is unhealthy.

    YYYY-MM-DDTHH:MM:SSZ In(14) vobd[2097762]:  [vSANCorrelator] 6115042983153us: [esx.audit.vob.vsan.lsom.diskgrouprebuild] Diskgroup eui.01######### is rebuilt successfully after MEDIUM error. Old UUID 5269a55d-####-####-####-######## New UUID 52254c5f-####-####-####-########.

  • 物理ディスクに障害が発生しています。これを検証するには、ハードウェア インターフェイスを確認します。

    例:
    iDRAC を使用している場合、ダッシュボードに「SYSTEM HAS CRITICAL ISSUES (システムに重大な問題があります)」という警告が表示されます。

ディスクのステータスとして、故障(Fault)を示していることが確認できます。

手順: iDRAC にログイン > ダッシュボード ページで [Storage (ストレージ)] オプションを選択 > [Physical Disks (物理ディスク)] を選択 > 物理ディスクのステータスを確認します。

Resolution

この状態でディスク グループから障害のあるディスクを削除するには、以下の手順を実行します。  

  1. 障害のあるディスクを搭載したホストを、「アクセシビリティの確保 (Ensure accessibility)」を選択してメンテナンスモードに移行します。  

  2. esxcliコマンドを使用したvSANディスクグループの管理と構成 を使用して、コマンドを使用し障害のあるディスクの削除を試みます。  

  3. もし、この操作で期待通りに障害ディスクを削除できない場合は、サーバーから障害のあるディスクを物理的に取り外し、新しいディスクと交換してから、手順 2 を再試行します。

  4. もし、それでも失敗する場合は、ホストの再起動を実施後、再度コマンドを使用し削除を実施します。  

  5. 新しく追加されたディスクをディスクグループに追加します。 

  6. ホストのメンテナンス モードを解除します。

注: vSAN ディスクグループが削除できない場合は、vSAN ディスクグループに対するさらなる操作を試みる前に、上記の手順に従って障害のあるディスクの対処を実施する必要があります。

Additional Information