1. 대규모 홈랩 클러스터의 최대 복병: 네트워크 브로드캐스트 스톰과 패킷 지연
12대 이상의 물리 노드가 단일 플랫(Flat) 네트워크 브리지에 연결되어 있으면 다음과 같은 치명적인 문제가 발생합니다:
- Corosync 하트비트 유실: Ceph 스토리지의 고속 디스크 복제 작업이 대역폭을 점유할 때, 클러스터 헬스체크 패킷이 지연되어 노드가 오프라인으로 잘못 판정되는 현상.
- CPU 인터럽트 폭증: 표준 MTU 1500 환경에서 초당 수십만 개의 이더넷 패킷을 처리하느라 CPU의 약 15~20%가 순수 네트워크 인터럽트에 낭비되는 병목.
이를 해결하기 위해 L2/L3 매니지드 스위치와 802.1Q VLAN 태깅, 그리고 점보 프레임(Jumbo Frame, MTU 9000)을 도입하여 네트워크 트래픽을 물리적/논리적으로 완전 분리했습니다.
2. 4계층 VLAN 네트워크 분할 설계
| VLAN ID | 네트워크 대역 | MTU 설정 | 주요 용도 및 트래픽 특성 |
|---|---|---|---|
| VLAN 10 | 192.168.10.0/24 | 1500 | 관리망 (Proxmox GUI, SSH, QDevice 투표) |
| VLAN 20 | 10.10.20.0/24 | 9000 (Jumbo) | Ceph 공용 클러스터 스토리지 복제 트래픽 |
| VLAN 30 | 10.10.30.0/24 | 1500 | AI 멀티에이전트 간 비동기 RPC 및 Ollama 스트림 |
| VLAN 40 | 10.10.40.0/24 | 1500 | 외부 DMZ망 (Cloudflare 터널 및 공용 웹 서비스) |
3. 리눅스 본딩(LACP 802.3ad) 및 MTU 9000 실전 인터페이스 설정
각 노드의 듀얼 2.5GbE 포트를 LACP(Link Aggregation)로 묶어 총 5Gbps의 대역폭과 무중단 링크 페일오버를 구현했습니다:
# /etc/network/interfaces 설정
auto lo
iface lo inet loopback
iface enp2s0 inet manual
iface enp3s0 inet manual
auto bond0
iface bond0 inet manual
bond-slaves enp2s0 enp3s0
bond-miimon 100
bond-mode 802.3ad
bond-xmit-hash-policy layer2+3
mtu 9000
# Ceph 전용 VLAN 20 브리지
auto vmbr20
iface vmbr20 inet static
address 10.10.20.141/24
vlan-raw-device bond0
vlan-id 20
mtu 9000
4. iperf3 성능 실측 및 CPU 점유율 비교
MTU 1500 vs MTU 9000 환경에서 12개 노드 간 64스레드 대용량 데이터 전송 테스트를 수행했습니다:
- MTU 1500: 4.62 Gbps 전송 시 단일 코어 CPU 점유율 42% 기록.
- MTU 9000: 4.91 Gbps 전송 시 단일 코어 CPU 점유율 11%로 급감 (약 73%의 CPU 리소스 절감 효과).
이 결과는 로컬 AI 추론과 Ceph I/O가 동시에 활발히 일어나는 홈랩 환경에서 노드의 성능 저하를 방지하는 핵심 기술적 토대가 되었습니다.