VMware Live Recovery (VLR) において、「健全性チェックの実行」タスクが 0% のまま進行しない事象が発生します。
・「健全性チェックの実行」タスクの開始時刻にて DR サイト側の VLR の hms.log ログに以下のエラーが記録されています。
SQLite error 1546: disk I/O error; While beginning transaction [disk I/O error]; Returned error message: disk I/O error; Retries exhausted after '20' attempts
・DR サイトのESXi ホストにて同時間に下記のログが確認できます。
Al(177) vmkalert: cpu11:2127913)ALERT: BC: 3042: File groupdb.db closed with dirty buffers. Possible data loss.
Wa(180) vmkwarning: cpu24:2097529)WARNING: BC: 3276: freeing file groupdb.db with stored error: No space left on device
今は該当データストアに容量枯渇しておらず十分な空き容量があります。
VMware Live Recovery 9.0.X
VMware Live Recovery の健全性チェック(ping test による接続性確認)では、HBR レプリケーショングループの構成情報を管理するメタデータファイル(groupdb.db)がデータストア上に作成されます。このメタデータファイルが配置されるデータストアの空き容量が一時的に枯渇したことによって、SQLite データベースである groupdb.db への書き込み時にストレージ I/O 障害(disk I/O error)が発生してファイルの構成に失敗するため、結果として健全性チェックタスクが 0% の状態から進行不能となります。
以下の対処を実施してスタック状態を解消します。
1.対象データストアに十分な空き容量が確保されていることを確認します。
vSphere Client (GUI) を使用した確認手順
1.vSphere Client にログインします。
2.ナビゲーションペインから [ストレージ] アイコンを選択します。
3.インベントリツリーを展開し、対象のデータストアをクリックします。
4.[サマリ] タブを開き、[容量と使用量] パネルにて「空き容量」を確認します。
2.ping testが失敗した ESXi ホストに SSH で接続します。
以下のコマンドを実行し、hbr-agent および hbrsrv サービスを再起動します。
/etc/init.d/hbr-agent restart
/etc/init.d/hbrsrv restart
3.保護サイトおよびDR サイトの両方の VLR の hms サービスの再起動を実施します。
以下のいずれかの方法で再起動を実施します。
・VLR アプライアンスに SSH で接続します。
以下のコマンドを実行し、hms サービスを再起動します。
systemctl restart hms
・ポート5480の VAMI 管理画面のサービス一覧より hms を再起動します。
4.「健全性チェックの実行」タスクが正常に進捗し、完了することを確認します。