Globální výpadek cloudu Amazonu: časová osa, příčina a rozsah

  • Globální incident AWS s epicentrem v US-EAST-1, který začal kolem 9:00 (poloostrovního času)
  • Amazon detekoval zdroj v DynamoDB a skrytý problém s DNS, přičemž do poledne došlo k postupnému zotavení.
  • Dopad na více služeb: Alexa, Prime Video, Canva, Duolingo, Snapchat a videohry jako Fortnite a Roblox
  • Konkrétní dopady pokračovaly i odpoledne, zatímco byla zaváděna zmírňující opatření.

Generický obrázek globálního výpadku AWS

Dalekosáhlý dopad na infrastrukturu Amazon Web Services (AWS) přerušovaně nechal tisíce platforem a aplikací v různých zemích bez provozu. Počet hlášení od uživatelů prudce vzrostl brzy ráno kvůli Chyby připojení, latence a neúspěšné nahrávání, se zvláštním zaměřením na Spojené státy a viditelnými účinky v Evropě.

Podle panelu pro hodnocení stavu společnosti problém vznikl v regionu. US-EAST-1 (Severní Virginie) a způsobil anomální nárůst chybovosti v několika API. Do poloviny dopoledne AWS oznámila jasné známky zotavení v řadě služeb, ačkoli týmy nadále pracovaly na úplném uzavření incidentu a obnovení veškerého provozu do normálu.

Chronologie incidentu

Byla vydána první varování kolem 9:00 (čas na španělském poloostrově), s krátkým vrcholem incidentů a neustálými upozorněními v monitorovacích nástrojích, jako je DownDetector. K 11:00 společnost oznámila, že identifikovala možná příčina a začal aplikovat zmírňující opatření, která urychlila obnovu v různých vrstvách.

Do poledne společnost AWS hlásila, že většina operací vykazuje normalizované chování, ačkoli varovala před specifickými omezeními pro určité aplikace a konkrétní služby v postižené oblasti. Během časného odpoledne zbytkové dopady zatímco stabilizační práce pokračovaly.

Ilustrace problémů v cloudu Amazonu

Kde byl technický původ

Společnost se zaměřila na Amazon DynamoDB, jeho spravovaná databázová služba klíč-hodnota, jejíž koncový bod na adrese US-EAST-1 zaznamenal selhání, která měla za následek kaskádování chyb napříč více závislostmi. AWS poukázala na základní problém s DNS jako spouštěč, který byl postupně zmírňován.

V praxi, když systém doménových jmen nefunguje správně, Aplikace nenacházejí své zdroje a dochází k chybám připojení, vypršením časového limitu a selháním načítání dat. Jako nouzové opatření společnost AWS doporučila, aby zákazníci s přetrvávajícími problémy vymazat mezipaměti DNS k obnovení rozlišení na správné koncové body.

Kdo byl postižen

Rozsah byl průřezový: samotný Amazon zaznamenal incidenty v Alexa y Prime Video, zatímco u třetích stran se vyskytly problémy v populárních službách, jako například Canva, Duolingo o snapchatSelhání byla zaznamenána také na platformách Generativní AI a v kolaborativních aplikacích, které se spoléhají na cloud AWS.

Ani digitální zábava nezůstala stranou. Velkoobjemové tituly a služby, jako například Fortnite, Roblox o Clash Royale nahlášené chyby Přihlásit se nebo konektivitu, zatímco některé obchody a herní launchery zavedly zmírňující opatření ke zmírnění dopadu, dokud se provoz nestabilizuje.

Dopad ve Španělsku

Na národní úrovni hlásilo několik uživatelů problémy s přístupem na aplikace digitálních služeb a webové stránky, se zvláštním dopadem kolem dopoledne. Platformy byly také postiženy prodej jízdenek jako například Ticketmaster, který odložil vydání oznámené na poledne; mezi nimi i vydání vstupenek spojených s velmi vyhledávané koncerty.

Finanční instituce a velké spotřebitelské platformy komunikovaly konkrétní incidenty v jejich online systémech, ačkoli dopad se lišil v závislosti na regionu a službě. Vzhledem k tomu, že byla v postiženém regionu USA zaváděna zmírňující opatření, bylo v Evropě pozorováno postupné obnovení přístupu.

Aktuální situace a doporučení

Jak hodiny plynuly, AWS naznačila, že viděla významné známky zotavení u většiny svých služeb, přičemž zachovává omezená omezení určitých operací v rámci US-EAST-1. Společnost nadále sleduje výkonnost a zavádí úpravy, aby problém plně vyřešila.

Pokud se stále setkáváte s ojedinělými problémy, můžete si prohlédnout oficiální stav AWS a v případě potřeby vyčistit mezipaměť DNS nebo restartujte klienty a služby, které závisí na rozlišení koncových bodů v postižené oblasti. V kritických nasazeních je vhodné ověřit přepnutí při selhání, síťové závislosti a zásady opakování pro minimalizaci dopadu latence a přechodných chyb.

Tato epizoda ukazuje, do jaké míry je infrastruktura cloud computing se pro digitální ekonomiku stalo strukturálním: lokální zhroucení klíčového uzlu se může promítnout do řetězové efekty v globálním měřítku, od streamování a hraní her až po finanční a produktivní aplikace.


Přidat jako preferovaný zdroj