출근과 퇴근 기록은 얼마나 완결되는가 — 근태 데이터 품질을 보는 법
근로시간 평균을 내기 전에 출근과 퇴근이 한 쌍으로 남았는지부터 봅니다.
쌍 완결률·계산 가능률·정정률 등 품질 지표 일곱 가지와,
근태 데이터에서 0과 미확인을 구별하는 기준을 정리했습니다.
근태 데이터에서 가장 먼저 봐야 할 숫자는 평균 근로시간이 아니라 「출근과 퇴근이 한 쌍으로 남았는가」입니다.
쌍이 깨진 하루는 근로시간을 계산할 수 없고,
그 하루를 어떻게 처리하느냐에 따라 같은 원자료에서 서로 다른 평균이 나옵니다.
이 글은 인사책 데이터랩이 자체 집계를 공개하기 전에 통과시키는 품질 점검 절차 — 쌍 완결성(paired),
결측,
정정 이력,
계산 가능 여부 — 를 정의와 함께 공개하는 방법론 문서입니다.
관측 표본의 실제 비율은 발행 시점의 스냅샷 자료에 분모와 함께 싣고,
이 문서에는 숫자를 고정하지 않습니다.
평균보다 출퇴근 쌍을 먼저 보는 이유
근로시간 평균은 원자료가 아니라 파생값입니다.
출근 시각과 퇴근 시각이라는 두 기록에서 하루치 근로시간을 만들고,
그 하루들을 다시 모아 평균을 냅니다.
그래서 평균을 결정하는 것은 소수점 아래 값이 아니라 「어떤 하루를 계산에 넣었는가」입니다.
퇴근 기록이 없는 하루를 생각해 보면 분명해집니다.
그 하루를 ①계산에서 빼면 분모가 줄고,
②0시간으로 넣으면 평균이 내려가고,
③소정근로시간으로 채우면 평균이 실제보다 안정적으로 보입니다.
세 처리 모두 그 자체로 「틀린 계산」이라 부르기는 어렵지만 서로 다른 답을 냅니다.
어느 것을 골랐는지 밝히지 않은 평균은 값을 공개한 것이 아니라 선택을 감춘 것입니다.
게다가 쌍이 깨지는 사건이 무작위로 흩어진다는 보장이 없습니다.
퇴근 기록 누락은 야근이 길어진 날,
현장을 급히 떠난 날,
교대가 자정을 넘긴 날에 몰릴 수 있고,
실제로 그런지는 결측이 어느 날에 몰렸는지를 직접 세어 봐야 알 수 있습니다.
결측이 특정 상황에 몰려 있으면 그 하루들을 빼는 순간 평균은 조용히 짧아집니다.
그래서 첫 질문은 「평균이 얼마인가」가 아니라 「평균을 만들 자격이 있는 하루가 전체의 몇 퍼센트인가」여야 합니다.
쌍 완결(paired)을 정의하는 법
판정 단위는 사람-날이다
쌍 완결은 기록 한 줄이 아니라 「한 사람의 하루」를 단위로 셉니다.
한 사람이 하루에 출근을 두 번 찍었다면 기록은 두 줄이지만 판정 대상은 하나입니다.
단위를 기록 줄로 잡으면 태그를 자주 찍는 사업장이 그만큼 분모를 키워,
회사마다 다른 습관이 품질 지표에 섞여 들어갑니다.
날짜 경계도 함께 정해야 합니다.
이 시리즈는 시간대를 Asia/Seoul로 고정하고,
자정을 넘긴 근무는 출근이 속한 날로 귀속시킵니다.
이 규칙을 적지 않으면 야간 교대가 있는 사업장에서 「퇴근만 있고 출근이 없는 날」과 「출근만 있고 퇴근이 없는 날」이 동시에 생겨,
같은 근무 하나가 두 번 미완결로 세어집니다.
무엇이 쌍을 깨는가
- 퇴근 기록 자체가 남지 않은 경우
- 자정을 넘긴 근무를 날짜 규칙 없이 잘라낸 경우
- 같은 시간대에 중복 기록이 쌓여 어느 것이 유효한지 정해지지 않은 경우
- 정정으로 대체된 원본을 유효 기록과 함께 센 경우
- 회사 귀속이 확정되지 않은 기록을 모집단에 넣은 경우
앞의 두 가지는 현장에서 생기고,
뒤의 세 가지는 집계하는 쪽에서 만듭니다.
품질 보고서는 이 둘을 구분해서 적어야 합니다.
집계가 만든 미완결을 현장 탓으로 적으면,
고쳐야 할 자리를 영영 찾지 못합니다.
정의를 먼저 적고 값을 나중에 잰다
정의가 값보다 먼저입니다.
분자에 무엇이 들어가고 분모가 무엇인지,
어떤 기록을 제외했는지를 먼저 문장으로 확정한 뒤에 계산합니다.
순서를 바꾸면 결과가 마음에 들지 않을 때 분모를 조정하게 되고,
그 순간 지표는 관측이 아니라 주장이 됩니다.
근태 데이터 품질 지표 일곱 가지
아래 표는 인사책 데이터랩이 공개 전 점검에 쓰는 지표입니다.
각 지표는 분자와 분모를 함께 적을 때만 뜻이 생깁니다.
| 품질 지표 | 분자 ÷ 분모 | 무엇을 뜻하나 | 값이 나쁘면 생기는 문제 |
|---|---|---|---|
| 쌍 완결률(paired rate) | 출근·퇴근이 모두 있는 사람-날 ÷ 출근 기록이 있는 사람-날 | 근로시간 계산의 재료가 되는 하루의 비율 | 결측이 야근·교대일에 몰려 있으면 평균이 실제보다 짧아진다 |
| 계산 가능률 | 근로시간 값이 실제로 산출된 사람-날 ÷ 쌍이 완결된 사람-날 | 쌍이 있다고 계산까지 간 것은 아니다 | 계산 실패분이 0시간으로 섞여 「일하지 않은 날」이 대량 생산된다 |
| 축 결측률 | 그 칸이 비어 있는 기록 ÷ 전체 유효 기록 | 인증 방식·사업장 같은 분류 축의 완성도 | 「방식별 점유율」이 기록이 남은 소수 회사의 습관으로 바뀐다 |
| 정정률 | 정정으로 대체된 기록 ÷ 전체 유효 기록 | 기록이 현장에서 얼마나 손을 타는가 | 정의 없이 낮은 값을 정확도로 홍보하면 기능 미사용을 품질로 오독한다 |
| 표본 편중(최대 기여율) | 가장 큰 회사의 기록 ÷ 전체 기록 | 한 회사가 전체를 대표하고 있는지 | 원시 가중 평균이 그 회사의 사규를 업계 평균으로 만든다 |
| 하위셀 규모 | 그 칸에 기여한 회사 수·근로자 수 | 표의 한 칸이 몇 곳에서 나왔는가 | 익명 집계가 사실상 특정 회사 공개가 된다 |
| 기간 커버리지 | 기록이 있는 활동일 ÷ 관측 기간의 일수 | 기간 전체가 고르게 관측됐는가 | 특정 주·특정 월의 사정이 전체 추세로 읽힌다 |
이 일곱 가지 중 하나라도 공개할 수 없다면 그 위에 얹은 평균도 공개할 수 없습니다.
품질 지표는 본문 통계의 부록이 아니라 발행 여부를 가르는 조건입니다.
0과 미확인은 다르다
한 칸에 섞여 있는 네 가지 값
| 표에 보이는 값 | 실제 뜻 | 잘못 읽으면 |
|---|---|---|
| 0 (관측됨) | 그날 근무가 없었다 | 정상값이다 — 이것만 평균에 넣어도 된다 |
| 0 (계산 실패) | 쌍은 있는데 근로시간이 채워지지 않았다 | 「0시간 근무」로 읽혀 평균을 끌어내린다 |
| 빈칸(NULL) | 그 축을 애초에 기록하지 않았다 | 조용히 제외되어 분모가 바뀐 줄 모른다 |
| 0건 (집계 결과) | 조건에 맞는 행이 없었다 | 필터·조인이 틀렸을 때와 구별되지 않는다 |
평균 함수는 이 넷을 구별하지 않습니다.
0으로 채워진 칸과 계산되지 않은 칸을 같은 열에 두는 순간,
두 번째 줄은 첫 번째 줄과 똑같은 자격으로 계산에 들어갑니다.
결측을 0으로 채우는 것은 데이터 정리가 아니라 없는 관측을 만들어 내는 일입니다.
네 번째 줄인 「0건」이 특히 위험합니다.
집계 결과가 0이면 대개 「그런 사례가 없다」로 읽지만,
필터가 틀렸거나 조인이 어긋났을 때도 똑같이 0이 나옵니다.
그래서 0을 발표하기 전에는,
값이 반드시 있어야 하는 조건으로 같은 쿼리를 한 번 더 돌려 계기가 살아 있는지 확인합니다.
이 확인을 거치지 않은 0은 관측이 아니라 침묵입니다.
표를 만들 때의 세 가지 규칙
- 모든 비율 옆에 분모를 함께 적는다.
- 결측은 별도 열로 남기고 0으로 채우지 않는다.
- 값이 0이면 「관측된 0」인지 「계산되지 않음」인지 표기를 다르게 한다.
정정 이력을 품질 지표로 쓰려면
인사책의 출퇴근 기록은 정정할 때 원본을 덮어쓰지 않습니다.
고친 시각으로 새 기록을 한 줄 더 쌓고,
원본에는 「대체됨」 표시를 답니다.
근태 기록은 임금과 법정 근로시간 한도를 다투는 자리에서 증거가 되므로,
값이 달라졌다면 무엇이 어떻게 달라졌는지가 함께 남아야 하기 때문입니다.
집계할 때는 대체되지 않은 유효 기록만 세고,
원본은 정정률을 계산하는 자리에서만 씁니다.
이 구조 덕분에 정정률을 지표로 쓸 수 있지만,
값을 읽는 방법에는 함정이 있습니다.
정정률이 낮다는 관측은 최소 두 가지 원인을 가집니다.
①기록이 실제로 정확해서 고칠 일이 적었거나,
②정정 기능을 아무도 쓰지 않았거나.
두 원인은 같은 숫자를 만들고,
숫자만으로는 갈리지 않습니다.
정정률을 공개하려면 「정정이 가능한 상태였던 기록」을 분모로 따로 세어 두 원인을 갈라야 합니다.
그래서 이 시리즈는 정의 없이 「정확도가 높습니다」 같은 문장을 쓰지 않습니다.
대신 무엇을 한 쌍으로 셌는지,
정정의 정의가 무엇인지,
분모에 무엇이 들어갔는지를 적습니다.
읽는 사람이 같은 정의로 자기 데이터를 재보고 우리 값과 비교할 수 있어야 인용할 가치가 생깁니다.
발행 전에 통과시키는 네 단계
1단계 — 모집단을 먼저 고정한다
승인된 실사용 회사만 남기고 데모·내부 운영 계정을 뺍니다.
제외는 이름 패턴이 아니라 명시된 필드로 합니다.
이름으로 거르면 「테스트」라는 낱말이 들어가지 않은 내부 계정이 조용히 남습니다.
2단계 — 지표를 계산하고 분모를 공개한다
위 일곱 지표를 계산하고,
본문에 쓸 모든 비율의 분모를 표에 함께 적습니다.
원시 기록에서 다시 계산한 값과 일별 요약에서 나온 값이 일치하는지 독립 쿼리로 대조합니다.
두 경로가 어긋나면 값이 아니라 계산 경로를 먼저 고칩니다.
3단계 — 작은 칸을 억제한다
기여 회사가 적거나 근로자 수가 적은 칸은 숨기거나 상위 구간으로 합칩니다.
익명 집계는 이름을 지우는 일이 아니라 되짚어 특정할 수 없게 만드는 일입니다.
숨긴 칸이 있으면 숨겼다는 사실 자체를 표에 남깁니다.
4단계 — 두 사람이 교차 검토한다
집계한 사람과 다른 사람이 표와 방법론을 다시 읽습니다.
통과하지 못하면 숫자를 낮춰 맞추지 않고 발행을 취소하며,
취소했다는 사실과 사유를 원장에 남깁니다.
사내 데이터에 그대로 적용하려면
같은 순서를 회사 안에서도 쓸 수 있습니다.
지난달 출근 기록이 있는 사람-날을 분모로 두고 퇴근이 함께 있는 날을 세어 쌍 완결률을 구한 뒤,
미완결이 몰린 요일·부서·근무형태를 확인하세요.
특정 교대조나 특정 사업장에 몰려 있다면 그것은 개인의 실수가 아니라 기록 방식이 그 현장과 맞지 않는다는 신호입니다.
근로시간 평균을 아직 발표하지 않는 이유
인사책 데이터랩은 현재 표본 현황과 데이터 품질까지만 공개하고,
근로시간 평균이나 초과근로 비율은 발표하지 않습니다.
이유는 두 가지입니다.
첫째,
계산 가능률에 결함이 있습니다.
일별 요약에서 근로시간 값이 채워지지 않는 문제가 확인됐고,
원인 규명과 재계산 검증이 끝나기 전까지는 그 위에 어떤 평균도 얹지 않기로 했습니다.
이 공백은 숨기지 않고 결함으로 기록해 두었으며,
수리가 끝난 뒤 별도 자료로 공개합니다.
둘째,
표본 편중이 큽니다.
특정 회사가 전체 기록의 큰 몫을 차지하는 상태에서 원시 기록에 그대로 가중치를 두면 그 회사의 근무 규칙이 「관측된 평균」이 됩니다.
회사 동일 가중이나 기여 상한 같은 처리를 먼저 선언하고,
하위집단 표본 조건을 충족한 뒤에야 행동 통계를 냅니다.
발표하지 않은 통계도 기록으로 남깁니다.
어떤 자료가 왜 취소됐는지를 함께 공개해야,
발행된 자료의 숫자에 비로소 의미가 생깁니다.
이 문서를 인용하는 방법
이 문서는 방법론이므로 그대로 인용하거나 자기 조직의 점검표로 바꿔 써도 됩니다. 공식 통계와 대조할 때는 조사 대상과 공표 주기가 다른 원자료를 함께 확인하세요 — 사업체 단위의 월별 근로시간은 고용노동부 사업체노동력조사,
고용형태별 임금·근로시간은 고용노동부 고용형태별근로실태조사가 각각 다른 질문에 답합니다.
두 조사 모두 국가통계포털(kosis.kr)과 고용노동부 누리집(moel.go.kr)에서 원자료와 공표 일정을 확인할 수 있습니다.
인사책 관측 표본은 이 공식 통계를 대체하지 않으며,
보완하는 자료로만 인용해 주세요.
권장 인용: 인사책 데이터랩, 「출근과 퇴근 기록은 얼마나 완결되는가 — 근태 데이터 품질을 보는 법」,
2026-09-25 갱신, https://insacheck.com/guides/attendance/출퇴근-기록-완결성-데이터품질-지표
범위: 이 문서는 근태 데이터의 품질 점검 방법을 설명하는 방법론 자료입니다. 인사책 관측 표본의
실제 비율은 별도의 표본 현황·품질 스냅샷 자료에서 분모와 함께 공개하며, 대한민국 전체
사업체를 대표하지 않습니다.
자주 묻는 질문
근로시간 평균을 내기 전에 왜 출퇴근 쌍부터 보나요?
쌍 완결률(paired rate)은 어떻게 계산하나요?
근태 데이터에서 0과 미확인은 어떻게 다른가요?
집계 결과가 0건이면 사례가 없다는 뜻인가요?
정정 이력이 적으면 데이터 품질이 좋은 건가요?
근태 통계를 공개할 때 표에 반드시 적어야 하는 것은 무엇인가요?
근거: 근로기준법 및 관련 법령 · 최근 업데이트: · 다음 검토: 분기별 검토
본 문서는 일반 정보 제공 목적이며,
개별 법률 자문이 아닙니다.
정확한 적용은 노무사/세무사 상담 권장.