複数のマネージャーノードとエッジノードでメモリ不足が発生し、プロセスが繰り返しクラッシュしてコアダンプが発生しています。
search cancel

複数のマネージャーノードとエッジノードでメモリ不足が発生し、プロセスが繰り返しクラッシュしてコアダンプが発生しています。

book

Article ID: 449304

calendar_today

Updated On:

Products

VMware NSX

Issue/Introduction

免責事項:これは英文の記事「Multiple Manager and Edge nodes are experiencing memory exhaustion, leading to repeated process crashes and core dump」の日本語訳です。記事はベストエフォートで翻訳を進めているため、ローカライズ化コンテンツは最新情報ではない可能性があります。最新情報は英語版の記事で参照してください。

  • NSX Manager アプライアンスまたは NSX Edge ノードの利用可能なメモリが非常に少なく、メモリ割り当ての失敗によりプロセスがクラッシュします。メモリ使用率が高いことに関連するアラームも /var/log/syslog に記録されます。
2025-05-26T10:24:05.130Z Example-EDGENODE NSX 18971 - [nsx@6876 comp="nsx-edge" subcomp="node-mgmt" username="root" level="CRITICAL" eventFeatureName="edge_health" eventType="edge_memory_usage_very_high" eventSev="critical" eventState="On"] The memory usage on Edge node #######-####-####-####-############ has reached 99% which is at or above the very high threshold value of 90%.
ag:02.428Z Example-EDGENODE NSX NSX 28058 - [nsx@6876 comp="nsx-edge" subcomp="node-mgmt" username="root" level="CRITICAL" eventFeatureName="edge_health" eventType="edge_memory_usage_very_high" eventSev="critical" eventState="On"] The memory usage on Edge node #######-####-####-####-############ has reached 99% which is at or above the very high threshold value of 90%.
  • /var/log/syslog には、以下のようなログ行が記録されます: 
    kernel - - - [13094823.723467] audit: audit_backlog=1187323 > audit_backlog_limit=8192
    kernel - - - [13094823.723469] audit: audit_lost=17229471 audit_rate_limit=0 audit_backlog_limit=8192
    kernel - - - [13094823.723470] audit: backlog limit exceeded
  • NSX Edge ノードの VM コンソールには、次のように表示される場合があります:
    grsec: failed fork with errno ENOMEM by ...
  • NSX Manager によって複数のコアが生成されました:
    var/log/core/ 内
    core.java
    core.opsAgent
    core.perl
    core.python3
  • NSX Edge Node によって複数のコアが生成されました:
    /var/log/core/ 内
    core.datapathd
    core.lb-dispatcher

注:上記のログ抜粋はあくまで例です。日付、時刻、および環境変数は、お客様の環境によって異なる場合があります。

Environment

VMware NSX-T Data Center
VMware NSX

Cause

カーネルには、監査バックログメッセージのキューイングに関する不具合があります。このため、バックログキューの長さが設定可能な最大キュー長を超える可能性があります。新しいバックログエントリはキューに追加されますが、削除されることはありません。最終的に、この状態がマネージャー/エッジのメモリ不足を引き起こし、複数のプロセスでメモリ割り当てエラーやクラッシュが発生します。

Resolution

この問題は、Broadcom Downloads で入手可能な VMware NSX-T 3.2.3 および VMware NSX 4.1.2 で解決されています。

ソフトウェアの検索およびダウンロードに問題がある場合は、ナレッジベース記事 Download Broadcom products, patches and software を参照してください。


回避策:

  • root アクセスが必要です。「start engineer」コマンドを使用して admin シェルから root シェルにアクセスするか、NSX アプライアンスに直接 root としてログインしてください。
  • 以下のコマンドを実行して、GRUBの設定を更新してください:
    sed -i '/GRUB_CMDLINE_LINUX/s/audit=1//' /etc/default/grub
    update-grub
  • その後、 NSX アプライアンスを再起動します。