Files
obsidian/history/2026-07-21-ops-agents-decommission.md

2.6 KiB

title, updated, tags
title updated tags
2026-07-21 ops agents 전체 삭제 2026-07-21
agent
ops
incident
decommission

배경

kappa 요청으로 내부 ops 에이전트 3개(Heimdall, Syn, Skuld) 전체를 삭제하고 재구성하기로 결정. 진행 과정에서 정본과 실제 상태의 불일치를 여러 건 발견.

발견 사항

  1. Heimdall(kr1, 10.100.3.108)은 이미 존재하지 않았음 — 정확한 삭제 시점 불명. 2026-06-01-longhorn-snapshot-retention-fix.md엔 그날까지 생존 기록이 있으나, 그 이후 언제/왜 사라졌는지 기록 없음. 조사 시점(2026-07-21)에 kr1엔 ops incus 프로젝트 자체가 없었고 default 프로젝트엔 brokkr/mariadb-2/postgres-2만 존재.
  2. kaffa/ops-agents-tofu 리포에 heimdall/ 워크스페이스가 없음ops-agents/overview.md엔 "tofu 관리 (kaffa/ops-agents-tofu/heimdall)"라고 적혀 있었지만 실제 리포엔 syn/, skuld/만 존재. Heimdall은 애초에 tofu로 관리되지 않았거나, 관리 흔적이 리포에서 사라진 것으로 추정.
  3. tofu state가 로컬 어디에도 없음 — Mac 전체를 뒤져도 terraform.tfstate 파일 없음. tofu destroy를 시도해도 관리 중인 리소스가 없다고 판단해 no-op이 될 상황이라, syn/skuld는 incus delete로 직접 삭제하는 쪽으로 방법 전환.
  4. kr1 tailscale(100.x) 라우팅 단절 — 로컬 Mac tailscale 데몬이 꺼져 있는 상태(Tailscale is stopped.)에서 kr1 서브넷(100.84.111.28 등)에 대한 subnet router 경유 접속도 안 됨. 2026-06-01 인시던트 때도 동일 증상 있었던 반복 이슈. LAN 직접 접속(192.168.9.214)으로 우회해 조사 완료 — kr1 자체는 정상 동작 중(K3s control-plane Ready).

수행

  • hp2 ops 프로젝트의 syn, skuld 컨테이너를 incus delete --force로 직접 삭제 (2026-07-21)
  • Heimdall은 이미 없어 별도 조치 없음
  • ops-agents/overview.md를 decommissioned 상태로 갱신

후속 (재구성 시 확인 필요)

  • Mac 로컬 tailscale 데몬이 반복적으로 꺼지는 근본 원인 확인 (버전 mismatch 의심 — 2026-06-01 기록 참고)
  • tofu state를 R2 등 원격 backend로 이전 — 로컬 단일 지점 보관 방식이 이번처럼 state 유실/소재불명 문제를 반복시킴
  • heimdall/ tofu 워크스페이스를 리포에 실제로 만들 것 (기존엔 문서만 있고 실체 없었음)
  • secret/apps/ops-agents-ssh (공유 SSH 키)는 유지됨 — 재구성 시 재사용 가능

수행: kappa (직접, tofu/incus 양쪽 확인 후 incus 경로로 삭제)