Edge アップグレード中の物理スイッチにおける GARP 処理の障害によるトラフィック断
search cancel

Edge アップグレード中の物理スイッチにおける GARP 処理の障害によるトラフィック断

book

Article ID: 447219

calendar_today

Updated On:

Products

VMware NSX

Issue/Introduction

免責事項:これは英文の記事「Traffic interruption during Edge upgrade due to physical switch GARP processing failure」の日本語訳です。記事はベストエフォートで翻訳を進めているため、ローカライズ化コンテンツは最新情報ではない可能性があります。最新情報は英語版の記事で参照してください。


  • NSX アップグレード中、Edge 高可用性 (High Availability、HA) フェイルオーバー後にアプリケーショントラフィックが長時間中断される場合があります。NSX-T アップグレードは成功しますが、受信トラフィックが新規アクティブ Edge ノードに到達できないことで "upstream timed out" エラーが発生してアプリケーションのダウンを引き起こします。これは上流の物理インフラストラクチャが以前アクティブだった (現在はスタンバイの) Edge ノードにトラフィックをルーティングし続けるために発生します。

Environment

  • NSX Edge (T0/T1)

Cause

  • フェイルオーバー後に上流の物理スイッチが MAC アドレスまたは ARP テーブルを更新できないことによりこの問題が発生します。NSX Edge が "Active" ロールになるとネットワーク更新のため Gratuitous ARP (GARP) パケットをブロードキャストします。もし物理スイッチがこれらの GARP パケットを無視または破棄した場合—多くの場合スパニングツリープロトコル (Spanning Tree Protocol、STP) 状態やセキュリティ設定が原因—物理スイッチは VIP の古い MAC と IP のマッピングを保持し続けます。物理スイッチの ARP キャッシュが自然に期限切れとなり新しい ARP リクエストが強制されるまで、トラフィックは宛先に到達不能となります。

Resolution

  • 物理スイッチが Gratuitous ARP ブロードキャストを許可して処理するようにしてください。
  • NSX Edge に繋がる物理スイッチポートを PortFast または Edge ポートとして設定してください。これによりポートがすぐフォワーディング状態に遷移してフェイルオーバー中の Edge により送信される最初の GARP ブロードキャストをスイッチが逃すことを防止します。
  • 上流のルーターで ARP タイムアウト設定を見直してください。タイムアウト値が過度に高い場合 GARP 受信漏れからの復旧時間が大幅に長期化します。
  • GARP 送信状況確認のため NSX Edge の syslog を監視してください。

Additional Information

GARP 受信漏れの詳細についてはこの KB を参照してください ---  Application Outage During NSX Edge Upgrade Failover Due to Missed GARP