見出し画像

物理NICのチーミング設定不良で通信断『仮想化の話⑨』

ホストは起動している。
VMも稼働中。
なのに 通信が突然切れる/断続的に不安定
原因は 物理NICチーミング設定不良
冗長化のつもりが、逆に不安定要因になっている例だ。


冒頭の一言要約

NICチーミングは“対向とセット”。
片側だけの思い込み設定は、通信断を招く。


症状(あるある)

  • 通信が数分おきに途切れる

  • vMotion/管理通信だけ不安定

  • 特定VLANだけ通信不可

  • ホスト再起動後にだけ発生

  • 片系ケーブル抜くと通信断

  • 負荷がかかると突然切れる


原因と仕組み(なぜ起きるか)

  • チーミング方式とスイッチ設定の不一致

  • Active/Active のつもりが対向SW未対応

  • LACP(802.3ad)設定が片側だけ

  • フェイルオーバー順序の誤設定

  • Load Balancing ポリシーの理解不足

  • VLAN/トランク設定が片系だけ違う

NICチーミングは
「ESXi設定 × 物理スイッチ設定」 の組み合わせ。
どちらかがズレると、
ループ・破棄・ブラックホール が起きる。


図:設定不一致で通信が迷子になる

[ESXi Host]
  vmnic0  Active
  vmnic1  Active  ← LACP想定
      │        │
[SW]  非LACP   非LACP
      ↓
通信断・破棄

切り分け(最短コース)

  1. ESXi のチーミング設定確認

    • Load Balancing ポリシー

    • Failover Order(Active/Standby)

  2. 物理スイッチ設定確認

    • LACP 有無

    • ポートチャネル設定

    • VLAN 設定の左右一致

  3. vmnic 単体での疎通確認

    • 片系ずつ Active にして確認

  4. エラーカウンタ確認

    • 物理SWの discard / error

  5. 発生条件の特定

    • 負荷時/フェイルオーバー時のみか


今すぐ効く対処(テンプレ)

◆ 安全第一の即席対処

  • Active / Standby 構成に変更

    • 片系を Standby に

    • Load Balancing:Route based on originating virtual port

→ 冗長性は確保しつつ、挙動が安定。


◆ LACP を使う場合(正攻法)

  • ESXi:LACP 対応のポートグループを使用

  • 物理SW:ポートチャネルを LACP で構成

  • VLAN / MTU / Speed/Duplex を完全一致

片側だけ LACP は絶対NG


恒久対策/再発防止チェックリスト

  • チーミング方式を設計段階で決定

  • ESXi と物理SWの設定を必ずペアで変更

  • 原則は Active/Standby から開始

  • LACP 使用時は対応可否を確認

  • VLAN/MTU/速度設定を左右一致

  • フェイルオーバーテストを実施

  • 構成図にチーミング方式を明記

  • 新ホスト追加時のチェック項目に含める


落とし穴(やりがちミス)

  • Active/Active にすれば速いと思い込む

  • LACP を“自動で何とかなる”と誤解

  • 片系ケーブルだけ違うVLAN

  • SW側は触らずESXiだけ変更

  • 冗長化=ノーテストで安心


まとめ(行動指針)

NICチーミングは
「冗長化」ではなく「協調動作」

方式を決める → 対向と揃える → 片系テスト。
この3点を守るだけで、
チーミング由来の通信断は確実に防げる。

いいなと思ったら応援しよう!