AWS 유럽 EU-SOUTH-2 리전서 2시간 40분 패킷 손실 장애…네트워크 설정 변경이 원인
아마존웹서비스(AWS)의 유럽 EU-SOUTH-2 리전에서 5일(현지시간) 약 2시간 40분 동안 네트워크 패킷 손실 장애가 발생했다가 복구됐다. AWS 공식 상태 페이지 공지에 따르면 원인은 네트워크 설정 변경이었고, 회사는 이 변경을 되돌려 문제를 해결했다.
AWS는 상태 페이지에서 미국 태평양 시간(PDT) 기준 5일 오전 8시 48분부터 11시 28분까지 EU-SOUTH-2 리전의 가용 영역(AZ) 한 곳(eus2-az1)에서 패킷 손실이 늘었다고 밝혔다. 한국 시간으로는 6일 0시 48분부터 오전 3시 28분까지다. 회사는 이 때문에 "여러 워크플로와 AWS 서비스에서 API 지연 시간과 오류율이 높아졌다"고 설명했다. 어떤 서비스가 영향을 받았는지는 공지에 나오지 않아 확인되지 않았다.
공지에 적힌 대응 과정은 이렇다. AWS는 장애가 시작되고 6분 뒤인 오전 8시 54분에 자동 경보로 문제를 알아챘다. 바로 원인을 찾기 시작하면서 피해를 줄이기 위한 조치도 여러 갈래로 동시에 진행했다. 오전 10시쯤 이 조치로 상황이 일부 나아졌고, 10시 38분에는 네트워크 설정 변경이 원인이라는 것을 찾아냈다. AWS는 해당 변경을 되돌렸고, 오전 11시 28분에 완전히 복구했다. 현재 서비스는 정상 운영 중이라고 회사는 밝혔다.
이번 장애는 리전 전체가 아니라 가용 영역 한 곳에서 일어났다. AWS는 전 세계 리전마다 전력·네트워크가 서로 독립된 데이터센터 묶음인 가용 영역을 여러 개 두고 있다. 한 곳에 문제가 생겨도 다른 가용 영역으로 서비스를 이어가라는 취지다. 그래서 AWS는 고객에게 중요한 서비스를 여러 가용 영역에 나눠 배치하라고 권한다. 거꾸로 말하면 eus2-az1 한 곳에만 자원을 둔 고객은 이번 장애의 영향을 직접 받았을 가능성이 크다. 다만 공지에 따르면 AWS 서비스 자체의 API 지연과 오류도 함께 늘었으므로, 여러 가용 영역에 나눠 배치한 고객도 영향을 전혀 받지 않았다고 단정하기는 어렵다.
원인이 외부 공격이나 하드웨어 고장이 아니라 내부 설정 변경이었다는 점도 눈에 띈다. 대형 클라우드 장애는 운영 중 설정을 바꾸는 과정에서 시작되는 경우가 적지 않다. 이번에도 원인을 찾는 데 장애 발생 후 1시간 50분, 설정을 되돌린 뒤 완전히 복구하는 데 다시 50분가량이 걸렸다. 이번 공지에는 설정 변경의 구체적인 내용이나 재발 방지 대책이 담기지 않았다. AWS가 별도의 사후 분석 보고서를 낼지도 아직 확인되지 않았다.
AWS는 세계 최대 클라우드 사업자다. 국내 기업이나 개발자가 이번 장애로 피해를 봤는지는 확인되지 않았다. 다만 유럽 서비스를 운영하려고 EU-SOUTH-2 리전을 쓰는 기업이라면 장애 시간대의 로그와 오류 기록을 점검해 보는 것이 좋다. 한국 시간으로는 새벽이었기 때문에 국내 운영 인력이 실시간으로 알아채지 못했을 수 있다. 장애 공지와 진행 상황은 AWS 상태 페이지(https://status.aws.amazon.com/)에서 볼 수 있다.