태그 보관물: certbot

Migrating Ingress Controller: ingress-nginx EOL to Traefik v3.7.5 with Wildcard TLS Automation

개요

kubernetes/ingress-nginx 프로젝트가 2026년 3월 31일부로 EOL(End of Life)을 선언하고 아카이브되었습니다. 이를 계기로 ingress-nginx에서 Traefik으로 마이그레이션을 진행하여 자체 관리형 Kubernetes 클러스터의 Ingress 컨트롤러를 Traefik v3.7.5로 교체하고, 모니터링 스택(Prometheus / Alertmanager / Grafana) 도메인을 *.sierracloud.dev로 전환하였습니다. 아울러 HAProxy 서버에서 관리하는 Let’s Encrypt 와일드카드 인증서를 Kubernetes 클러스터에 자동 동기화하는 CronJob을 구성하였습니다.

대안으로 Contour, Kong, HAProxy Ingress 등을 검토하였으나, Traefik을 선택한 이유는 다음과 같습니다. Helm chart가 잘 관리되고 있으며, TLSStore를 통한 와일드카드 인증서 중앙 관리가 가능합니다. 또한 CRD(IngressRoute, Middleware 등)를 통한 고급 라우팅 설정과 Kubernetes Ingress 표준 오브젝트와의 호환성을 동시에 지원합니다. HTTP → HTTPS 강제 리다이렉트도 values.yaml 설정 한 줄로 처리됩니다.


환경

  • Kubernetes v1.33.7 (HA: Control Plane 3대 + Worker 3대)
  • MetalLB — LoadBalancer IP 풀: 192.168.x.x/29
  • HAProxy (192.168.x.x:6443) — K8s API LB 및 HTTPS 리버스 프록시 겸용
  • NAS — Let’s Encrypt 인증서 원본 보관, NFS export
  • 교체 전: kubernetes/ingress-nginx v1.10.1 (EOL)
  • 교체 후: Traefik v3.7.5 (Helm chart 41.0.0)

단계별 절차

1. ingress-nginx 설정 백업

삭제 전에 기존 설정을 코드로 백업하여 재설치 시 활용할 수 있도록 보존합니다.

# IngressClass, ConfigMap, Ingress 리소스 백업
kubectl get ingressclass nginx -o yaml > backup/ingress-nginx/ingressclass-nginx.yaml
kubectl get cm ingress-nginx-controller -n ingress-nginx -o yaml > backup/ingress-nginx/configmap-controller.yaml
kubectl get ingress -n monitoring -o yaml > backup/ingress-nginx/ingress-monitoring.yaml

# Helm values 백업
helm get values ingress-nginx -n ingress-nginx -o yaml > backup/ingress-nginx/helm-ingress-nginx-values.yaml

# 삭제 절차 문서화 후 제거
helm uninstall ingress-nginx -n ingress-nginx

2. Traefik v3.7.5 설치

ingress-nginx가 사용하던 MetalLB IP를 그대로 유지하여 HAProxy의 백엔드 설정 변경 없이 전환합니다.

helm repo add traefik https://traefik.github.io/charts
helm repo update

helm upgrade --install traefik traefik/traefik \
  -f helm/traefik-values.yaml \
  -n traefik --create-namespace

helm/traefik-values.yaml 핵심 설정:

service:
  annotations:
    metallb.universe.tf/loadBalancerIPs: "192.168.x.x"   # 기존 IP 유지

ingressClass:
  enabled: true
  isDefaultClass: true

ports:
  web:
    http:
      redirections:
        entryPoint:
          to: websecure
          scheme: https
          permanent: true   # HTTP → HTTPS 전체 리다이렉트

3. 모니터링 도메인 변경

*.sierracloud.kro.kr에서 *.sierracloud.dev로 전환하고 ingressClassName을 교체합니다. Helm values 수정 후 upgrade를 적용합니다.

# helm/monitoring-values.yaml (변경 부분)
prometheus:
  ingress:
    ingressClassName: traefik    # nginx → traefik
    hosts:
      - prometheus.sierracloud.dev

grafana:
  ingress:
    ingressClassName: traefik
    hosts:
      - grafana.sierracloud.dev
  grafana.ini:
    server:
      domain: grafana.sierracloud.dev
      root_url: https://grafana.sierracloud.dev
      protocol: http             # Traefik이 TLS 종료, Grafana 내부는 HTTP
helm upgrade monitoring prometheus-community/kube-prometheus-stack \
  -f helm/monitoring-values.yaml -n monitoring

4. 와일드카드 TLS 인증서 자동화

HAProxy 서버에서 certbot이 Let’s Encrypt 인증서를 주기적으로 갱신하고 NAS에 복사합니다. Kubernetes CronJob이 이후 NAS NFS를 마운트하여 SHA256 비교 후 변경 시에만 Secret을 갱신합니다.

certbot (HAProxy)
  └─→ NAS (NFS)
        └─→ K8s CronJob (SHA256 비교)
              └─→ traefik/wildcard-sierracloud-dev Secret
                    └─→ Traefik TLSStore default → 모든 서비스 자동 적용

TLSStore를 사용하면 각 네임스페이스의 Ingress 리소스에 secretName을 지정할 필요 없이 모든 HTTPS 라우트에 와일드카드 인증서가 자동으로 적용됩니다.

# manifests/traefik/tls-store.yaml
apiVersion: traefik.io/v1alpha1
kind: TLSStore
metadata:
  name: default
  namespace: traefik
spec:
  defaultCertificate:
    secretName: wildcard-sierracloud-dev

CronJob은 매주 갱신 주기에 맞춰 실행되며 SHA256 비교를 통해 인증서가 변경된 경우에만 Secret을 업데이트합니다.

# manifests/traefik/tls-secret-sync.yaml (핵심 부분)
schedule: "30 6 * * 1"    # 매주 월요일
timeZone: "Asia/Seoul"
concurrencyPolicy: Forbid

volumes:
  - name: certs
    nfs:
      server: 192.168.x.x
      path: /data/cert
      readOnly: true
# CronJob 컨테이너 스크립트 (요약)
CURRENT_SHA=$(kubectl get secret wildcard-sierracloud-dev -n traefik \
  -o jsonpath='{.data.tls\.crt}' | base64 -d | sha256sum | cut -d' ' -f1)
NEW_SHA=$(sha256sum < /certs/sierracloud.dev/fullchain.pem | cut -d' ' -f1)

if [ "$CURRENT_SHA" != "$NEW_SHA" ]; then
  kubectl create secret tls wildcard-sierracloud-dev \
    --cert=/certs/sierracloud.dev/fullchain.pem \
    --key=/certs/sierracloud.dev/privkey.pem \
    -n traefik --dry-run=client -o yaml | kubectl apply -f -
fi

트러블슈팅

① bitnami/kubectl 이미지 태그 없음

증상: CronJob 컨테이너 이미지 bitnami/kubectl:1.33이 ImagePullBackOff 발생.

원인: 2025년 12월 이후 bitnami/kubectl Docker Hub 레포지토리에서 버전 태그가 삭제됨 (GitHub issue #88999). latest 태그만 존재.

해결: alpine/k8s:1.33.10으로 교체. Alpine 기반으로 kubectl + 기본 유틸리티(sha256sum, base64 등) 포함, K8s 1.33.x 버전과 동일 minor version으로 완전 호환.

image: alpine/k8s:1.33.10    # bitnami/kubectl:1.33 → 교체

② 도메인 변경 후 Traefik 503 (약 5초)

증상: Helm upgrade 직후 prometheus.sierracloud.dev, grafana.sierracloud.dev 접속 시 503 반환.

원인: Traefik이 새로운 Ingress 라우트를 동기화하는 데 약 5초 소요.

해결: 별도 조치 없이 자연 해소. Traefik의 정상적인 라우트 갱신 동작.


검증

# Traefik LoadBalancer IP 확인
kubectl get svc -n traefik

# TLSStore 적용 확인
kubectl get tlsstore -n traefik

# Secret 인증서 유효기간 확인
kubectl get secret wildcard-sierracloud-dev -n traefik \
  -o jsonpath='{.data.tls\.crt}' | base64 -d | openssl x509 -noout -subject -dates

# HTTPS 접속 확인
curl -skI https://grafana.sierracloud.dev | head -3
curl -skI https://prometheus.sierracloud.dev | head -3
# 출력 예시
HTTP/2 302       ← Grafana 로그인 리다이렉트 (정상)
HTTP/2 405       ← Prometheus (정상)

subject=CN = *.sierracloud.dev
notAfter=Sep 17 13:39:09 2026 GMT

결론

ingress-nginx EOL 전환을 계기로 Traefik v3.7.5를 도입하고, Let’s Encrypt 와일드카드 인증서의 자동 갱신 파이프라인을 구성하였습니다. Secret을 traefik 네임스페이스에 단일 관리하고 TLSStore default로 노출함으로써 향후 신규 서비스 추가 시 Ingress에 secretName을 별도 지정할 필요 없이 자동으로 와일드카드 인증서가 적용됩니다.

기존 ingress-nginx와의 전환 과정에서 MetalLB LoadBalancer IP를 그대로 유지했기 때문에 HAProxy 백엔드 설정 변경 없이 완전한 무중단 전환이 가능하였습니다. Traefik v3 계열의 Kubernetes Gateway API 지원, 향상된 observability, 그리고 CRD 기반의 미들웨어 체인 설정은 장기적인 운영에서도 ingress-nginx 대비 유리한 점이 많습니다.

참고

관련 포스트:

참고 문서: Traefik TLSStore Default Certificate (공식 문서) · Traefik Helm Chart 설치 가이드

Let’s Encrypt 인증서 생성 실패

개요

certbot을 사용해 Let’s Encrypt 인증서 생성 실패가 발생하는 원인은 다양하지만, RHEL/Rocky Linux 계열의 서버에서는 SELinux가 certbot의 HTTP 인증 프로세스를 차단하여 실패하는 경우가 있습니다. Apache가 설치된 환경에서는 Apache 자체는 SELinux 정책에 자동 등록되지만, certbot이 도메인 검증 시 사용하는 80/443 포트 바인딩용 독립 프로세스는 SELinux 정책에 등록되지 않아 차단됩니다. 이 글에서는 오류 내용과 SELinux 비활성화를 통한 해결 방법을 정리합니다.

증상 — certbot 실행 오류

certbot으로 인증서 발급을 시도하면 webroot 플러그인 관련 오류가 발생하며 인증서 발급이 완료되지 않습니다.

@:~# sudo certbot certonly --cert-name  -d www.
...
certbot.errors.PluginError: Every requested domain must have a webroot when using the webroot plugin.
2025-01-01 01:13:52,404:ERROR:certbot._internal.log:Every requested domain must have a webroot when using the webroot plugin.

원인 분석 — SELinux 정책 미등록

SELinux가 enforcing 모드로 활성화된 경우, Apache처럼 사전에 SELinux 정책이 등록된 서비스는 정상 동작하지만, certbot이 도메인 인증 시 새로 바인딩하는 포트(80, 443)용 프로세스는 정책이 없어 차단됩니다. 이 때문에 certbot이 ACME challenge 응답을 처리하지 못하고 실패합니다.

# SELinux 현재 상태 확인
@:~# sestatus
SELinuxfs mount:                /sys/fs/selinux
SELinuxfs status:                 enabled
SELinux mount directory:         /etc/selinux
Loaded policy name:              targeted
Current mode:                    enforcing

해결 방법 — SELinux 비활성화

SELinux 정책을 개별 추가하는 방법도 있으나, 서버 환경에서 SELinux 제어가 불필요한 경우 비활성화 처리가 가장 빠른 해결책입니다. /etc/sysconfig/selinux 파일에서 SELINUX=disabled로 변경한 뒤 재부팅합니다.

@:~# vi /etc/sysconfig/selinux
SELINUX=disabled

@:~# init 6

# 재기동 이후 SELinux 상태 확인
@:~# sestatus -v
SELinux status:                 disabled

SELinux 영구 비활성화 vs 임시 비활성화

/etc/sysconfig/selinux를 수정하고 재부팅하는 방식은 영구 비활성화입니다. 재부팅 없이 즉시 permissive 모드(정책 위반은 로깅만 하고 차단하지 않음)로 전환하려면 setenforce 0을 사용합니다. Permissive 모드는 SELinux 정책 개발이나 문제 진단 시 유용하며, 재부팅하면 /etc/sysconfig/selinux에 설정된 모드로 복귀합니다.

# 현재 세션에서만 permissive로 전환 (재부팅 후 원복)
setenforce 0

# 다시 enforcing으로 전환
setenforce 1

# 현재 상태 확인
getenforce

SELinux를 완전히 비활성화하는 대신 certbot에 대한 SELinux 정책만 추가하는 방법도 있습니다. audit.log에서 certbot 관련 AVC 거부 메시지를 확인하고 audit2allow 도구로 커스텀 정책 모듈을 생성할 수 있습니다. 그러나 프로덕션 서버에서 SELinux가 필수가 아닌 환경이라면 비활성화가 더 단순하고 확실한 해결책입니다.

결과 확인 — 인증서 재발급

SELinux 비활성화 후 certbot을 재실행하면 인증서가 정상 발급됩니다. 인증서 경로와 만료일을 확인합니다.

@:~# sudo certbot certonly --cert-name  -d www.
...
Successfully received certificate.
Certificate is saved at: /etc/letsencrypt/live//fullchain.pem
Key is saved at:         /etc/letsencrypt/live//privkey.pem
This certificate expires on 2025-03-31.
Certbot has set up a scheduled task to automatically renew this certificate in the background.

자동 갱신 확인

certbot은 인증서 발급 완료 시 --standalone 또는 --webroot 플러그인에 따라 systemd timer 또는 cron 기반 자동 갱신 태스크를 등록합니다. 자동 갱신이 정상 동작하려면 서버가 재부팅된 후에도 SELinux 상태가 disabled인지 확인해야 합니다. SELinux를 재활성화한 경우 certbot 갱신 시 다시 차단될 수 있습니다.

# systemd timer 확인 (RHEL 8+)
systemctl status certbot-renew.timer

# 갱신 dry-run 테스트
certbot renew --dry-run

# 인증서 만료일 확인
certbot certificates

참고

관련 포스트:

참고 문서: certbot standalone 플러그인 공식 문서 · RHEL SELinux 상태 변경 공식 문서