서버 모니터링
서버 오프라인, 자원 사용량, PM2 재시작 알림과 시계열 보존 기간을 설명합니다.
알림 threshold는 현재 고정 계약입니다. 별도 편집 API는 제공하지 않습니다.
조건 | Trigger | Resolve |
|---|---|---|
heartbeat 중단 | 마지막 heartbeat 후 90초 | heartbeat 수신 시 |
CPU 사용량 | 90% 이상 5분 | 85% 미만 5분 |
memory 사용량 | 90% 이상 5분 | 85% 미만 5분 |
disk 사용량 | 90% 이상 5분 | 85% 미만 5분 |
PM2 restart | 같은 process가 10분 안에 3회 이상 재시작 | 조건 해소 후 |
중복 이벤트는 event별 dedupe key로 줄입니다. 서버 상세 화면의 알림 배지에서 활성 알림 수를 확인할 수 있습니다.
데이터 | 보존 기간 |
|---|---|
raw | 7일 |
raw | 3일 |
5분 | 90일 |
5분 | 30일 |
raw hypertable은 1일 chunk를 사용하고 rollup은 5분 주기로 갱신합니다.
heartbeat가 기본 15초 간격이어도 네트워크나 호스트 중단을 90초까지 기다린 뒤 offline이 됩니다. 자원 알림은 순간적인 peak가 아니라 5분 지속 조건입니다. 상세 차트의 범위는 1시간, 6시간, 24시간, 7일을 제공합니다.
gateway의 live connection 상한은 모든 조직을 합쳐 총 1,000개입니다. 조직별 용량 보장은 아니므로 대규모 연결이 필요하면 별도 용량 검토가 필요합니다.
알림이 예상과 다르면 먼저 서버의 lastSeenAt과 에이전트 상태를 확인하세요.
그 다음 해당 시각의 차트와 capability 상태를 함께 확인하면 수집 중단과 실제 자원 초과를 구분할 수 있습니다.
이 페이지가 도움이 되었나요?