kaffa
0e21b94f3b
n8n 장애: pcp.conf 근본 원인(entrypoint 미생성) 및 helm-charts 수정 내역 반영
2026-07-11 12:59:03 +09:00
kaffa
fa94725b47
n8n 장애: pgpool stale primary 감지 + pcp.conf 누락 기록
2026-07-11 12:52:26 +09:00
kaffa
84ca2400b2
outline-data 사건 후속: 타 볼륨 점검 결과 추가 — 버스트성 증가 패턴 확인
...
- 전체 볼륨 재점검 결과 현재는 250 한도까지 여유 있음(최대 55개)
- 단 n8n 등 약 10개 볼륨에서 2026-07-10 하루에만 21~22개씩
몰아서 생성되는 버스트 패턴 발견 (평소엔 하루 1개 수준)
- outline-data가 겪은 장기 버스트(한 달)와 같은 계열 현상으로 추정,
다른 볼륨도 장기화되면 250 한도에 도달할 위험 있음을 기록
2026-07-11 12:41:31 +09:00
kaffa
0cc814a91e
outline-data 스냅샷 사건: 2026-06-01 retention 수정이 미검증 상태로 방치돼 재발했음을 확인
...
- 2026-06-01 RecurringJob spec.labels patch는 그대로 살아있으나
실제 신규 스냅샷에 recurring-job 라벨이 여전히 안 붙는 것을 재확인
- 라벨 결함이 특정 볼륨이 아닌 전 볼륨 공통이며, outline-data는
쓰기 빈도가 높아 250 하드캡에 먼저 도달한 것으로 추정
- 다른 고빈도 쓰기 볼륨도 시간 경과 시 동일 문제 위험 있음을 문서화
2026-07-11 12:28:45 +09:00
kaffa
9de9b51469
outline-data Longhorn 스냅샷 250개 하드캡 초과 사건 기록 및 해결
...
- k3s 정기 점검 중 outline-data 볼륨 스냅샷 256개(하드캡 250 초과)로
critical-snapshot/critical-backup 신규 생성 실패 발견
- kubectl delete(webhook이 finalizer 유지)와 파드 재배포/재attach
둘 다 무효였음을 확인 후, Longhorn REST API snapshotPurge 반복 호출로
256 -> 58개 정상화
- 근본 원인(retain 정책이 왜 이 볼륨만 실패했는지)은 미확정으로 남김
2026-07-11 12:24:41 +09:00
kaffa
881a5ce7a5
rustdesk.inouter.com A레코드 추가 (DNS-only) + 클라이언트 설정 호스트명으로 갱신
2026-06-11 22:56:32 +09:00
kaffa
1290b66d38
RustDesk 자체호스팅 서버 jp1 incus 배포 (원격지원)
2026-06-11 22:51:37 +09:00
kaffa
605102d55b
inbest SFTP 전송장애 실제원인 정정: 서버 아닌 FileZilla 전송연결 비번오류 (해결). 서버측 nginx/penalty면제는 부수개선
2026-06-11 14:17:12 +09:00
kaffa
0b3a8598b0
inbest SFTP 장애 근본원인: PerSourcePenalties (공유 SNAT source 페널티), 면제로 해결
2026-06-11 12:18:42 +09:00
kaffa
3f053101af
zlambda: inbest SFTP 릴레이 socat→nginx stream 교체 (2026-06-11)
2026-06-11 11:48:24 +09:00
kaffa
eaa80a63f8
history: kr2 k3s hang 근본원인 확정(Type=notify+TimeoutStartSec=0)+조치(TimeoutStartSec=300 drop-in, apisix-etcd reinit). HAProxy 변경 금지 명시
2026-06-11 11:06:34 +09:00
kaffa
72ac1113ed
history: 2026-06-11 kr2 k3s 8h hang 인시던트 (Patroni failover 후 read-only DB로 kine wedge, kill+restart 복구)
2026-06-11 07:29:24 +09:00
kaffa
bbf1706a36
zlambda: inbest SFTP 포워딩 socat을 NixOS systemd 서비스로 선언화 (docker→systemd)
...
+ 운영메모: nixos-infra git remote SSH→HTTPS 교체, flake는 tracked 파일만 빌드(git add 필수)
2026-06-10 17:59:10 +09:00
kaffa
d1537df4ef
zlambda: inbest SFTP 포트포워딩 구성 (socat 릴레이 139.162.71.52:2201 → kr2 sftp 컨테이너)
...
- alpine/socat 컨테이너로 2201→10.100.1.158:22 투명 relay (tailscale 경유)
- 공개 엔드포인트 139.162.71.52:2201, inbest/inbest1004 로그인 검증 완료
- Linode 방화벽 2201 인바운드 허용 (zlambda는 별도 Linode 계정, 사용자 관리)
- TODO: nixos-infra 선언화
2026-06-10 15:39:12 +09:00
kaffa
dedc011ed0
searxng: google retry 패치 시도·롤백 기록 (lite-shell은 IP당 rate, 단일IP 재시도로 해결 불가, ~100%엔 egress IP 풀 필요)
2026-06-10 15:11:48 +09:00
kaffa
e95c206824
searxng: google 0건 후속 진단·조치 기록 (timeout/uaPatch/CPU, 0%→~50%)
2026-06-10 14:34:03 +09:00
kaffa
76de92d1ff
searxng: tlsproxy를 zlambda(100.78.51.18:8443)에 재배포, 정본 갱신
...
- tlsproxy 소스 유실 확인, apisix-osaka 보존 이미지+CA로 zlambda 이식
- SearXNG proxy.address 죽은 IP(100.79.87.48)→zlambda 실IP 교정 (helm-charts repo)
- config repo 정정: kaffa/k8s 아님 → kaffa/helm-charts charts/searxng (ArgoCD)
- 남은 이슈: google.py data-ved 파서 vs Google JS-shell HTML (상류 엔진 문제)
2026-06-10 14:16:05 +09:00
kaffa
f4a934d644
infra: hp1 SSH 가능 정정(kaffa@) + hermes ssh config(전 incus 호스트 별칭) 기록
2026-06-10 09:46:51 +09:00
kaffa
ead9101010
infra: hermes 보조 재분류 - 단순(ollama) vs 추론·판단(codex). 원칙 명확화
2026-06-09 19:09:06 +09:00
kaffa
185c66a0d9
infra: hermes 보조 ollama 병행 검증 완료 - auxiliary 10종 전수 지정, NAT IP 검증법
2026-06-09 19:05:17 +09:00
kaffa
0390b7ad6e
infra: hermes를 Debian 13 재구성으로 정본 갱신 (NixOS→Debian, graphify 구조추출, 토큰 정리)
2026-06-09 18:27:26 +09:00
kaffa
2b70f3b607
infra: hermes 보조모델(kr1 ollama LAN)+telegram gateway 구성, ollama LAN 도달 정정
2026-06-09 17:43:14 +09:00
kaffa
2533ecf1a2
infra: hermes NixOS 컨테이너 정본 추가 (hp2, Hermes Agent + Codex 백엔드)
2026-06-09 17:10:58 +09:00
kaffa
b1ba9f1d90
k3s-to-incus-migration: APISIX 서울 유지·Tofu+Ansible·kr1 GPU 확정
2026-06-01 13:25:42 +09:00
kaffa
a44ff12f15
infra/compute: K3s → Incus 이전 플랜 초안
2026-06-01 13:22:11 +09:00
kaffa
fbb3506643
history: Longhorn sftpgo corruption loop 해소 + snapshot 자동 retention 영구 수정
...
- sftpgo replica kr1 13분 주기 corruption loop → kr2 anti-affinity reschedule로 해소
- root cause: snapshot .checksum 누락 + chain meta 손상 (디스크 정상)
- 시스템 차원 발견: 906/906 snapshot이 recurring-job 라벨 누락
- snapshot 일괄 정리 906 → 194 (volume당 7~8개)
- RecurringJob 4개 spec.labels patch — 자동 retention 영구 수정
- 후속: ArgoCD/IaC 매니페스트 반영 필요
2026-06-01 11:38:19 +09:00
kaffa
156e1b2dce
history: termix image.tag 명시 고정은 정책 위배 — :latest 복귀 위임 기록
...
- 사용자 정책: 컨테이너 이미지 tag는 :latest 유지가 디폴트
- 헤임달의 image.tag 고정 변경 및 본 history의 '교훈' 가이드 모두 정정
- 헤임달에 :latest 복귀 별도 위임
2026-05-29 19:56:38 +09:00
kaffa
26cd0ba2ba
history: termix :latest → release-2.3.1 업그레이드 + image.tag 명시 고정
...
- chart 0.1.2 → 0.1.4, commit 5d3b027
- ImagePullBackOff 1차 실패 (release tag 이름 vs registry tag 이름 차이) 기록
- ArgoCD Synced/Healthy, pod Running, https://termix.inouter.com/ HTTP 200
2026-05-29 19:52:04 +09:00
kaffa
1a944bdd6b
nas: r8152 v2.20.1-1 → v2.21.4-1 (LPM 재발 대응) + spk_su 설치 절차 기록
...
- 5/24 LPM disconnect 재발 → 새 카드 4일 만에 빈도 증가
- bb-qq r8152 패키지 업그레이드. 첫 install이 의도적으로 fail (spk_su 부재) → spk_su manual install 후 SPK 재install로 정상화
- 검증: status=running, driver v2.21.4 (2025-10-28), end-to-end JF (ping -M do -s 8972) 통과
- 효과(LPM 발화 빈도 감소)는 며칠 관찰 필요
- nas-storage.md에 5/24 재발 + 5/26 업그레이드 시점 추가
- history/2026-05-26 신규 — 설치 절차 함정(spk_su) 정리
2026-05-26 17:12:02 +09:00
kaffa
03ef787444
cf-bouncer: fall-mvp.com zone 제거 — netbis CF bouncer 21일 만에 동기화 재개
...
fall-mvp.com zone이 CF에서 삭제되어 bouncer가 2026-05-02부터 fatal 루프로 정지. config에서 2줄 제거 후 enable+start. LAPI pull 2026-05-23T04:56:28Z로 갱신 확인.
- infra/security/crowdsec-safeline.md: 적용 zone 6 → 5
- history/2026-05-23-cf-bouncer-fall-mvp-removal.md: 인시던트 기록
2026-05-23 14:00:25 +09:00
kaffa
ae8d8b7dfa
history: kr1 k3s 12시간 stuck — etcd/cf-bouncer/longhorn 연쇄 인시던트 기록
...
2026-05-22 20:02 JST kr1 k3s.service가 activating 상태로 12시간 매달려 노드 NotReady → instance-manager 9d Terminating → 4 볼륨 degraded + apisix-etcd-0 raft 손상까지 연쇄. systemctl restart 한 번으로 4분 안에 회복. 재발 방지 룰 정리.
2026-05-23 10:41:58 +09:00
kaffa
5be51134c9
incus-hp1 storage-net 참여 사실 반영 + kr2 multus-shim ETXTBSY 인시던트 기록
...
- infra-hosts.md: hp1 행 갱신 (이전 "1GbE only" → 2.5G 192.168.205.227, MAC 20:e1:5d:6a:2b:2e, MTU 9000 JF OK), 2.5G 표 hp1 행 추가, NAS NIC 정보(USB cdc_ncm → r8152 RTL8157 chip rev 14 + MAC)로 정확화, 호스트 자원 표에 hp1 추가, SSH 정보 라인에 hp1 접근 한계 명시
- nas-storage.md: K3s 노드 표 3→4 노드로 갱신 (hp1 추가), nodeAffinity 설명 표현 갱신
- history/2026-05-20-kr2-multus-shim-etxtbsy.md: ETXTBSY 데드락 RCA 및 `rm /opt/cni/bin/multus-shim` 회피책 기록
2026-05-20 17:10:07 +09:00
kaffa
ba30121962
NAS eth2 USB 2.5GbE 카드 교체 (rev 17 → rev 14, USB 4-1 → 2-2)
...
- ethtool: 2500 Mb/s Full Duplex 정상 협상
- iperf v2 (MTU 9000): TX 2.26 Gbit/s, RX 2.45 Gbit/s (이론 91%/98%)
- DSM ifcfg가 슬롯 기반으로 eth2 자리 자동 매핑 → 이름/IP/MTU 승계
- watchdog 그대로 유효, 새 카드도 RTL8157 계열이므로 LPM 재발 모니터링 대상
2026-05-20 15:41:31 +09:00
kaffa
0223c832ab
history: complete safeline chaos/detector-logs preemptive PVC replacement (2026-05-18)
2026-05-18 19:35:38 +09:00
kaffa
aec8891bac
history: add 2026-05-18 detector PVC follow-up + remaining timebombs (chaos / detector-logs)
2026-05-18 17:54:15 +09:00
kappa
2763e33675
history: SafeLine RWX PVC ext4 호환성 인시던트 복구 기록 (2026-05-17)
2026-05-17 16:33:53 +09:00
kaffa
bc01809643
incus-kr2: K3s/reboot 동반 작업 전 iommu=pt 사전 체크 항목 추가
2026-05-14 16:57:09 +09:00
kaffa
f0de7a3c37
infra-hosts: frontmatter updated 누적 보존 (iommu=pt 기록 복원)
2026-05-14 12:28:12 +09:00
kaffa
821c5a6278
infra-hosts: K3s 4노드 v1.34.5 → v1.34.7+k3s1 patch 업그레이드 (2026-05-14)
2026-05-14 12:27:10 +09:00
heimdall
81e270a90f
longhorn: snapshot-purge 임시 cron 회수 (1.11.2 fix 적용 후 의미 소멸)
2026-05-09 20:37:13 +09:00
heimdall
02a9b9dfd8
longhorn: 1.11.1 → 1.11.2 (snapshot warning #12856 fix)
2026-05-07 08:10:59 +09:00
kaffa
0a45e0536c
AMD-Vi (IOMMU) Completion-Wait timeout 메커니즘 정본 신설
...
incus-kr2 freeze 사건 분석으로 확정된 IOMMU 부분 hang 메커니즘과
운영 규칙(`iommu=pt` 선제 적용)을 별도 reference 문서로 분리.
호스트 사연(history)과 메커니즘(reference)을 분리해 다른 AMD Ryzen
호스트 도입 시 재사용 가능한 정본으로 정리.
- infra/compute/amd-vi-iommu.md 신규 (메커니즘 + 차단 + 운영 규칙)
- compute _index.md, hosts/incus-kr2.md, history 문서에 링크
2026-05-05 11:47:31 +09:00
kaffa
35f1e16f09
incus-kr2 freeze 원인 = AMD-Vi (IOMMU) Completion-Wait timeout
...
호스트 약 2주 간격 freeze 재발 패턴 분석 결과 AMD Ryzen 6900HX의
IOMMU Completion-Wait queue stall이 근본 원인. GRUB cmdline에
`iommu=pt` 추가하여 IOMMU passthrough 모드로 차단.
- infra/compute/hosts/incus-kr2.md 신규 (호스트 정본)
- history/2026-05-04-amd-iommu-freeze.md 신규 (사건 기록)
- _index.md / infra-hosts.md 갱신
2026-05-05 07:18:28 +09:00
kaffa
e068f18955
dev: Karpathy LLM 코딩 4원칙 참고 문서 추가
2026-05-04 09:22:49 +09:00
heimdall
46419eb8a1
longhorn: snapshot-purge cron 워크어라운드 (v1.11.1 stuck snapshot)
2026-05-02 15:22:51 +09:00
kaffa
1b1c968826
infra/network/beryl-ax: zram swap (zstd) 섹션 추가
...
휴대용 라우터의 빠듯한 RAM(491MB, swap 없음) 대비 CPU가 95% idle인
환경적 특성에 맞춰 zram 압축 swap을 도입. lzo 기본을 zstd로
전환해 압축률 ~1.5배 향상. 설치/검증/UCI 영구화 절차 정리.
2026-05-02 08:06:22 +09:00
kaffa
ebac715db5
infra/network: Beryl AX (GL-MT3000) 휴대용 라우터 문서 추가
...
GL.iNet 4.8.1 기본 설정에서 fw3 tailscale0 zone에 masq 옵션이
누락되어 LAN→tailnet forward 시 SNAT가 안 되는 문제와, dnsmasq
ts.net split-forward 미설정으로 MagicDNS 동작 안 하는 문제를
정리. 영구 UCI 설정과 Mac 측 /etc/resolver/ts.net + search domain
보정까지 포함.
2026-05-01 19:37:20 +09:00
heimdall
3afb3c884d
outline: history 갱신 — pgpool DML 라우팅도 동일 버그, haproxy-pg override 영구 유지
2026-04-29 15:44:44 +09:00
heimdall
23a91899e5
outline: 0.82.0 -> 1.7.0 메이저 업그레이드 (OIDC SameSite 쿠키 수정)
2026-04-29 15:30:25 +09:00
kaffa
b9300e6798
domain-boundaries: ironclad 자체 cycle 추가
...
ironclad 트래픽 흐름을 명시:
- CF + BunnyCDN 병행 entry (zone proxied 패턴별 분기)
- OpenWrt 라우터 (192.168.9.1) → MetalLB → K3s APISIX + SafeLine
- 1차 limit-req + 2차 chaitin-waf in-line gRPC
- 로그: VL → CrowdSec acquisition → 자작 4종 + hub 시나리오
- enforce layer: CF/BunnyCDN bouncer 모두 폐기 후 재구축 미정
· CF bouncer: netbis-cf-firewall과 동일 패턴으로 kappa account용 추가 운영 후보
· BunnyCDN bouncer: BlockedIps API 또는 Shield Access List(Advanced) — Ticket 388529 답변 후 결정
자산 매핑 표를 netbis/ironclad/bridge로 분리해 명시
추적 시 주의 항목 보강
2026-04-27 07:44:24 +09:00