Auto-sync: 2026-09-29
This commit is contained in:
@@ -3,7 +3,7 @@ title: Proxmox VE Cluster
|
||||
category: systems
|
||||
tags: [proxmox, virtualization, lxc, qemu, pve]
|
||||
created: "2026-04-28"
|
||||
modified: "2026-09-26"
|
||||
modified: "2026-09-29"
|
||||
---
|
||||
|
||||
# Proxmox VE Cluster
|
||||
@@ -50,7 +50,7 @@ pvesh get /cluster/resources --type vm # Alle VMs/CTs
|
||||
- Benötigte modprobe.d Config:
|
||||
- `blacklist amdgpu` + `blacklist drm` + `blacklist drm_kms_helper`
|
||||
- `options vfio-pci ids=1002:13c0` + `softdep amdgpu pre: vfio-pci`
|
||||
- Worker-05 (VM 102) läuft auf ms-a2-2 mit funktionierendem GPU-Passthrough
|
||||
- Worker-05 (VM 102) lief auf ms-a2-2 mit funktionierendem GPU-Passthrough. Seit 2026-09-29 auf proxmox6 (Anti-Collocation mit Worker-01). Prüfen ob GPU-Passthrough auf proxmox6 funktioniert!
|
||||
|
||||
## Bekannte Probleme
|
||||
- CT110 kaputte libc — Reparatur ausstehend (still stopped)
|
||||
@@ -60,21 +60,71 @@ pvesh get /cluster/resources --type vm # Alle VMs/CTs
|
||||
|
||||
## HA Rules (PVE 9.2 Rules System)
|
||||
Seit 2026-09-28: HA Groups → Rules migriert. Anti-Collocation + Node-Affinity.
|
||||
Seit 2026-09-29: RKE2 CP/Worker + Hermes hinzugefügt.
|
||||
|
||||
**Resource-Affinity (negative = anti-collocation):**
|
||||
|
||||
*RKE2 Control Plane (etcd-Quorum braucht 2/3):*
|
||||
- `rke2-cp-anti-112-122`: vm:112 ↔ vm:122 — nie auf gleichem Host
|
||||
- `rke2-cp-anti-112-126`: vm:112 ↔ vm:126 — nie auf gleichem Host
|
||||
- `rke2-cp-anti-122-126`: vm:122 ↔ vm:126 — nie auf gleichem Host
|
||||
|
||||
*RKE2 Worker:*
|
||||
- `rke2-worker-anti-102-128`: vm:102 ↔ vm:128 — nie auf gleichem Host
|
||||
- `rke2-worker-anti-102-139`: vm:102 ↔ vm:139 — nie auf gleichem Host
|
||||
- `rke2-worker-anti-128-139`: vm:128 ↔ vm:139 — nie auf gleichem Host
|
||||
|
||||
*Galera:*
|
||||
- `galera-anti-300-301`: vm:300 ↔ vm:301 — nie auf gleichem Host
|
||||
- `galera-anti-300-302`: vm:300 ↔ vm:302 — nie auf gleichem Host
|
||||
- `galera-anti-301-302`: vm:301 ↔ vm:302 — nie auf gleichem Host
|
||||
|
||||
*MaxScale:*
|
||||
- `maxscale-anti-310-311`: vm:310 ↔ vm:311 — nie auf gleichem Host
|
||||
|
||||
**Node-Affinity (non-strict, failover allowed):**
|
||||
|
||||
*RKE2 CP:*
|
||||
- `na-vm112`: vm:112 → proxmox3, proxmox5, proxmox7
|
||||
- `na-vm122`: vm:122 → ms-a2-1, ms-a2-2
|
||||
- `na-vm126`: vm:126 → proxmox4, proxmox5, proxmox6
|
||||
|
||||
*RKE2 Worker:*
|
||||
- `na-vm102`: vm:102 → proxmox5, proxmox6, proxmox7 (NICHT ms-a2-2!)
|
||||
- `na-vm128`: vm:128 → ms-a2-2, proxmox5, proxmox7
|
||||
- `na-vm139`: vm:139 → n5pro, proxmox3, proxmox4
|
||||
|
||||
*Hermes:*
|
||||
- `na-vm230`: vm:230 → n5pro, proxmox5, proxmox6
|
||||
|
||||
*Galera/MaxScale:*
|
||||
- `na-vm300`: vm:300 → n5pro, proxmox3, proxmox4
|
||||
- `na-vm301`: vm:301 → proxmox6, proxmox5, proxmox7
|
||||
- `na-vm302`: vm:302 → ms-a2-2, ms-a2-1
|
||||
- `na-vm310`: vm:310 → proxmox7, proxmox5, proxmox4
|
||||
- `na-vm311`: vm:311 → ms-a2-1, ms-a2-2
|
||||
|
||||
> ⚠️ PVE 9.2 Constraint: Resources in resource-affinity rules dürfen keine multi-priority node-affinity haben (gleiche Priorität für alle Nodes erforderlich).
|
||||
**Aktuelle Verteilung (alle Anti-Collocation erfüllt):**
|
||||
| Role | VM | Node |
|
||||
|------|----|------|
|
||||
| RKE2 CP-01 | 112 | proxmox3 |
|
||||
| RKE2 CP-02 | 122 | ms-a2-1 |
|
||||
| RKE2 CP-03 | 126 | proxmox4 |
|
||||
| RKE2 Worker-01 | 128 | proxmox5 |
|
||||
| RKE2 Worker-04 | 139 | n5pro |
|
||||
| RKE2 Worker-05 | 102 | proxmox6 |
|
||||
| Hermes-Agent-01 | 230 | n5pro |
|
||||
| Galera db1 | 300 | n5pro |
|
||||
| Galera db2 | 301 | proxmox6 |
|
||||
| Galera db3 | 302 | ms-a2-2 |
|
||||
| MaxScale-01 | 310 | proxmox7 |
|
||||
| MaxScale-02 | 311 | ms-a2-1 |
|
||||
|
||||
> ⚠️ PVE 9.2 Constraints:
|
||||
> - Resources in resource-affinity rules dürfen keine multi-priority node-affinity haben (gleiche Priorität für alle Nodes erforderlich).
|
||||
> - `ha-manager add` MUSS vor `ha-manager rules add` kommen — sonst "cannot use unmanaged resource".
|
||||
> - Bei gleichzeitigem HA-Add + Anti-Collocation-Violation kann HA-Manager deadlocks (beide VMs auf `migrate` fest). Lösung: eine VM temporär aus HA entfernen, manuell migrieren, dann re-add.
|
||||
> - Online-Migration von VMs mit hohen Memory-Writes (>12GB dirty pages) kann `broken pipe` fehlschlagen. Offline-Migration (stop→migrate→start) als Fallback.
|
||||
|
||||
## Related
|
||||
- [[systems/ceph-cluster]]
|
||||
|
||||
Reference in New Issue
Block a user