기사 검색

이슈부터 IT·AI·연예·게임까지, 메타브리프의 기사를 찾아보세요.

IT

깃허브 액션 작업 지연 장애 해소… "상위 애저 인프라의 스로틀링이 원인"

개발자 협업 플랫폼 깃허브(GitHub)의 자동화 기능인 '깃허브 액션(GitHub Actions)'에서 작업이 지연되는 장애가 발생했다가 해소됐다. 깃허브 공식 상태 페이지에 따르면 이번 장애의 공지 제목은 'Actions Job Delays(액션 작업 지연)'다. 회사는 상위 의존 서비스인 마이크로소프트 애저(Azure)에서 스로틀링(처리량 제한)이 걸려 일부 호스티드 러너(hosted runner)의 성능이 떨어졌다고 설명했다. 장애는 협정세계시(UTC) 기준 10월 1일 17시 56분, 한국시간으로는 10월 2일 오전 2시 56분에 '해결됨(Resolved)'으로 바뀌었다.


상태 페이지에 남은 기록을 보면 깃허브는 UTC 기준 10월 1일 16시 10분(한국시간 2일 오전 1시 10분) 업데이트에서 "상위 제공업체에서 문제를 확인했다"고 처음 알렸다. 이 시각보다 앞선 공지가 있었는지, 실제 지연이 언제부터 시작됐는지는 공개된 자료로는 확인되지 않았다. 이어 16시 48분에는 "완화 조치를 적용하고 있으며 30분 안에 복구될 것으로 예상한다"고 밝혔다. 17시 50분에는 "서비스 처리 용량이 회복됐다"며 애저 측과 근본 원인을 함께 살피면서 모니터링을 이어가겠다고 했다. 6분 뒤인 17시 56분에 해결 공지가 올라왔다. 첫 원인 확인 공지부터 해결 공지까지는 1시간 46분이 걸렸고, 30분 안에 복구하겠다고 예고한 시점부터는 약 1시간 만에 정상화됐다.


깃허브는 해결 공지에서 "상세한 근본 원인 분석(RCA)은 준비되는 대로 공유하겠다"고 밝혔다. 애저에서 스로틀링이 왜 일어났는지, 영향을 받은 러너가 어느 지역의 어떤 종류였는지, 전체 사용자 중 얼마나 영향을 받았는지는 현재까지 공개되지 않았다.


깃허브 액션은 코드를 저장소에 올리면 빌드·테스트·배포 같은 작업을 자동으로 실행해 주는 지속적 통합·배포(CI/CD) 도구다. 이 작업을 실제로 처리하는 가상 머신을 '러너'라고 부르는데, 사용자가 직접 서버를 마련하는 '셀프 호스티드 러너'와 깃허브가 클라우드에서 제공하는 '호스티드 러너'로 나뉜다. 이번 장애는 호스티드 러너 일부에서 생겼다. 깃허브가 직접 운영하는 인프라가 아니라 그 아래에 있는 클라우드 자원에서 처리량 제한이 걸려 상위 서비스까지 지연이 이어진 경우다. 깃허브는 마이크로소프트 자회사이고 호스티드 러너도 같은 회사의 애저 위에서 돌아간다. 하위 인프라에 문제가 생기면 그 위에 얹힌 개발 도구까지 함께 영향을 받을 수 있다는 점이 이번에도 드러났다.


장애 시간대는 한국시간 새벽 1~3시 무렵이어서 국내 업무 시간과는 대부분 겹치지 않았다. 다만 야간 정기 빌드나 예약 배포를 깃허브 액션에 맡겨 둔 국내 기업·개발자라면 해당 시간대 작업이 늦게 실행됐거나 시간 초과로 실패했을 수 있다. 그 시간대 워크플로 실행 기록을 확인하고, 실패한 작업은 다시 실행해 보는 것이 좋다. 장애 경과와 추후 공개될 원인 분석은 깃허브 상태 페이지 공지(https://www.githubstatus.com/incidents/2dpbcq5j165n)에서 볼 수 있다.