物理NICのチーミング設定不良で通信断『仮想化の話⑨』
ホストは起動している。
VMも稼働中。
なのに 通信が突然切れる/断続的に不安定。
原因は 物理NICチーミング設定不良。
冗長化のつもりが、逆に不安定要因になっている例だ。
冒頭の一言要約
NICチーミングは“対向とセット”。
片側だけの思い込み設定は、通信断を招く。
症状(あるある)
通信が数分おきに途切れる
vMotion/管理通信だけ不安定
特定VLANだけ通信不可
ホスト再起動後にだけ発生
片系ケーブル抜くと通信断
負荷がかかると突然切れる
原因と仕組み(なぜ起きるか)
チーミング方式とスイッチ設定の不一致
Active/Active のつもりが対向SW未対応
LACP(802.3ad)設定が片側だけ
フェイルオーバー順序の誤設定
Load Balancing ポリシーの理解不足
VLAN/トランク設定が片系だけ違う
NICチーミングは
「ESXi設定 × 物理スイッチ設定」 の組み合わせ。
どちらかがズレると、
ループ・破棄・ブラックホール が起きる。
図:設定不一致で通信が迷子になる
[ESXi Host]
vmnic0 Active
vmnic1 Active ← LACP想定
│ │
[SW] 非LACP 非LACP
↓
通信断・破棄
切り分け(最短コース)
ESXi のチーミング設定確認
Load Balancing ポリシー
Failover Order(Active/Standby)
物理スイッチ設定確認
LACP 有無
ポートチャネル設定
VLAN 設定の左右一致
vmnic 単体での疎通確認
片系ずつ Active にして確認
エラーカウンタ確認
物理SWの discard / error
発生条件の特定
負荷時/フェイルオーバー時のみか
今すぐ効く対処(テンプレ)
◆ 安全第一の即席対処
Active / Standby 構成に変更
片系を Standby に
Load Balancing:Route based on originating virtual port
→ 冗長性は確保しつつ、挙動が安定。
◆ LACP を使う場合(正攻法)
ESXi:LACP 対応のポートグループを使用
物理SW:ポートチャネルを LACP で構成
VLAN / MTU / Speed/Duplex を完全一致
※ 片側だけ LACP は絶対NG。
恒久対策/再発防止チェックリスト
チーミング方式を設計段階で決定
ESXi と物理SWの設定を必ずペアで変更
原則は Active/Standby から開始
LACP 使用時は対応可否を確認
VLAN/MTU/速度設定を左右一致
フェイルオーバーテストを実施
構成図にチーミング方式を明記
新ホスト追加時のチェック項目に含める
落とし穴(やりがちミス)
Active/Active にすれば速いと思い込む
LACP を“自動で何とかなる”と誤解
片系ケーブルだけ違うVLAN
SW側は触らずESXiだけ変更
冗長化=ノーテストで安心
まとめ(行動指針)
NICチーミングは
「冗長化」ではなく「協調動作」。
方式を決める → 対向と揃える → 片系テスト。
この3点を守るだけで、
チーミング由来の通信断は確実に防げる。
