2026년 9월 22일 화요일
METABRIEF — Insights. Connection. Innovation.
IT

AWS 미 동부 리전서 EC2 신규 인스턴스 생성 오류…1시간 17분 만에 해소


아마존웹서비스(AWS) 공식 상태 페이지에 따르면, 22일(현지시간) 미국 동부(US-EAST-1) 리전에서 신규 인스턴스 생성 요청의 오류율이 높아지는 장애가 발생했다. 공지에 기재된 장애 제목은 '서비스 영향: 오류율 증가(Service impact: Increased Error Rates)'다. 장애는 미 서부 시간 오후 3시 49분부터 5시 6분까지 약 1시간 17분간 이어졌으며, 회사는 해당 장애가 해소됐다고 밝혔다. 한국 시간으로는 23일 오전 7시 49분부터 9시 6분 사이에 해당한다.


상태 페이지 설명을 보면, 이 시간 동안 고객이 런인스턴시스(RunInstances)와 크리에이트플릿(CreateFleet) 등 EC2 인스턴스 생성 관련 작업을 시도할 때 오류율이 평소보다 높게 나타났다. 고객을 대신해 EC2 인스턴스를 띄우는 다른 서비스들도 함께 영향을 받았다. 회사는 아마존 ECS와 AWS 파게이트(Fargate), 아마존 EMR 등을 영향 대상으로 명시했다. 컨테이너 배포, 서버리스 실행, 대규모 데이터 처리 작업 등 '새 자원을 띄우는' 단계가 걸린 셈이다. 이미 실행 중이던 인스턴스가 어떤 영향을 받았는지는 공지에 언급되지 않았다.


원인으로는 인스턴스 생성 요청을 처리하는 EC2 내부 서브시스템에 최근 이뤄진 배포가 지목됐다. 회사는 문제가 된 배포의 롤백에 착수했고 초기 회복 징후를 관찰하기 시작했다고 설명했다. 다만 상태 페이지에 공개된 설명문은 이 대목에서 문장이 끊겨 있어, 롤백 완료 시점과 복구 경과의 세부 내용은 확인되지 않았다.


이번 장애가 발생한 US-EAST-1은 AWS가 가장 먼저 구축한 리전 가운데 하나로, 이용량이 많고 여러 글로벌 서비스의 기본 리전으로 쓰인다. 국내 기업이나 개발자 역시 미국 시장을 겨냥한 서비스나 해외 협업 도구를 이 리전에 올려두는 경우가 적지 않다. 장애가 신규 인스턴스 생성 구간에 집중된 만큼, 트래픽 증가에 맞춰 서버를 자동으로 늘리는 오토스케일링이나 빌드·테스트를 위해 임시 인스턴스를 띄우는 작업에서 오류를 겪었을 가능성이 있다.


장애 원인이 하드웨어 고장이 아니라 '최근 배포'로 지목된 점도 눈에 띈다. 클라우드 인프라는 이용자가 직접 손댈 수 없는 내부 구성 변경의 영향을 그대로 받는 구조여서, 단일 리전 의존을 줄이고 다중 리전·다중 가용영역 설계를 검토해야 한다는 지적이 반복돼 왔다.


영향을 받은 고객사 규모나 국내 피해 여부는 공지에 담기지 않았다. 별도의 사후 분석 보고서 공개 여부도 현재까지 확인되지 않았다. AWS 서비스를 이용하는 기업과 개발자는 회사 공식 상태 페이지(status.aws.amazon.com)에서 리전별 서비스 상태와 후속 공지를 직접 확인할 수 있다.