Google Cloud-un sentyabrın 1-də baş verən bir neçə saatlıq nasazlığının arxasından olduqca qeyri-adi səbəb çıxıb. Şirkətin açıqlamasına görə, texniki xidmət zamanı mühəndislərdən biri şəbəkəyə qoşulmuş optik kabelləri ardıcıl şəkildə çıxarıb və nəticədə Google Cloud-un us-central1-b zonasındakı bəzi resurslar xarici şəbəkədən tamamilə təcrid olunub.

Hadisə yerli vaxtla saat 07:41-də başlayıb və 11:52-yə qədər davam edib. Nasazlığın ən ciddi mərhələsində təsirlənən zonadan keçən şəbəkə trafikinin 100 faiz azaldığı, paket itkisinin isə kəskin artdığı bildirilir. Nəticədə həmin zonada işləyən bir sıra virtual maşın və xidmətlər istifadəçilər üçün əlçatmaz olub.
Maraqlısı budur ki, Google-un məlumat mərkəzlərində məhz belə nasazlıqların qarşısını almaq üçün bir neçə ehtiyat mexanizmi mövcuddur. Şəbəkə infrastrukturu ikiqat və hətta üçqat nasazlığa tab gətirəcək şəkildə qurulub. Avadanlıqlar ayrı-ayrı enerji mənbələrindən qidalanır və şəbəkə bağlantıları üçün bir neçə müstəqil optik xətt istifadə olunur.
Lakin bu dəfə problem ehtiyat sistemlərinin sıradan çıxmasından deyil, onların hamısının faktiki olaraq eyni anda bağlantısının kəsilməsindən yaranıb.
Google-un araşdırmasına əsasən, standart texniki xidmət həyata keçirən mühəndis cəmi 13 dəqiqə ərzində optik bağlantıların 100 faizini ardıcıl şəkildə ayırıb. Proses o qədər sürətlə həyata keçirilib ki, səhv tam şəbəkə bağlantısı kəsilməzdən əvvəl müəyyən edilərək dayandırıla bilməyib.
Kabellərin çıxarılmasından sonra us-central1-b zonasındakı bəzi şəbəkə avadanlıqları və virtual maşınlar xarici dünya ilə fiziki əlaqəni itirib. Sistemlər öz aralarında müəyyən səviyyədə məlumat mübadiləsini davam etdirə bilsələr də, istifadəçilər həmin resurslara kənardan daxil ola bilməyiblər.
Google problemi müəyyən etdikdən sonra trafiki əlaqəsi kəsilmiş şəbəkə avadanlıqlarından regionun digər hissələrində fəaliyyət göstərən infrastruktura yönləndirib. Daha sonra mühəndislər optik kabelləri yenidən qoşaraq şəbəkənin ilkin konfiqurasiyasını bərpa ediblər.
Hadisə böyük bulud infrastrukturlarında çoxsaylı ehtiyat sistemlərinin olmasına baxmayaraq, insan səhvinin kritik nasazlığa səbəb ola biləcəyini bir daha göstərib. Məlumat mərkəzlərində avadanlıq və şəbəkə xətləri sıradan çıxdıqda xidmətin davam etməsi üçün müxtəlif qoruma mexanizmləri qurulur. Lakin texniki xidmət zamanı bütün ehtiyat bağlantıların ardıcıl şəkildə fiziki olaraq ayrılması həmin qoruma mexanizmlərinin də təsirsiz qalmasına səbəb ola bilər.
Hadisənin ardından Google-un bu tip texniki xidmət prosedurlarını və eyni anda çoxsaylı kritik bağlantıların kəsilməsinin qarşısını alan nəzarət mexanizmlərini yenidən nəzərdən keçirməsi gözlənilir.













































