Amazon Web Services, Amazon Elastic Container Service (Amazon ECS) için önemli bir iyileştirme yayınlayarak aracı bağlantısı zarar gören konteyner örnekleri için otomatik tespit ve kurtarma mekanizmaları sunu. Bu operasyonel güncelleme, bulut yöneticilerinin ve DevOps mühendislerinin manuel müdahalesine gerek kalmadan, tespit edilemeyen iş yükü kesintilerini azaltmayı ve uygulama dayanıklılığını maksimize etmeyi amaçlıyor.
Daha önce, altyapı anomalileri yerel ECS aracı ile merkezi ECS kontrol düzlemi arasındaki kritik iletişim köprüsünü kestiğinde, iş yükleri uzun süren sessiz hatalara maruz kalabiliyor veya zahmetli operatör triyajı gerektirebiliyordu. Yeni devreye alınan çerçeve altında Amazon ECS, geniş bir fiziksel ve sanal stres faktörü yelpazesinde aracı sağlık metriklerini sürekli olarak takip ediyor. EBS birim bozulması, öngörülemeyen ana bilgisayar termal artışları veya ani ağ izolasyon olayları gibi donanım anomalilerinden kaynaklanan aksaklıklar artık sistematik olarak işaretleniyor.
İşlem Modelleri Genelinde Kapsamlı Sağlık İzleme
Bu yeni yeteneğin çekirdeğini, AGENT_CONNECTIVITY olarak bilinen özel bir sağlık değişimi olayının sunulması oluşturuyor. Bu tanılama sinyali, hizmet tarafından desteklenen tüm büyük işlem dağıtım seçeneklerine yerel olarak entegre edilmiştir:
- AWS Fargate: Tamamen yönetilen düzenlemeye sahip sunucusuz konteyner altyapısı.
- Amazon ECS Managed Instances: Konteyner iş yüklerini çalıştırmak için kolaylaştırılmış altyapı yönetimi seçenekleri.
- Amazon ECS on EC2: Müşteriler tarafından doğrudan yönetilen geleneksel sanal makine örnekleri.
Standartlaştırılmış sağlık değişimi olaylarını yayınlayarak hizmet, kontrol düzlemi telemetrisini tehlikeye atan altyapı düzeyindeki bağlantı kesilmelerine karşı anında görünürlük sağlar.
Otomatik İyileştirme ve Örnek Yaşam Döngüsü Yönetimi
AGENT_CONNECTIVITY olayının operasyonel etkisi, seçilen dağıtım mimarisine bağlı olarak değişir. AWS Fargate ve Amazon ECS Managed Instances gibi yönetilen ortamlar için düzenleme motoru, otomatik iyileştirme iş akışlarını yürütür. Aracı bağlantısının koptuğu onaylandığında sistem, tehlikeye giren düğümdeki etkin görevleri proaktif olarak boşaltır, uygulama iş yüklerini sürdürmek için yeni işlem kapasitesi sağlar ve sorunlu örneği kümeden sorunsuz bir şekilde kaydettirir.
İş yüklerini Amazon ECS on EC2 üzerinde çalıştıran kurumsal müşteriler için düzenleme platformu, tam olarak aynı sağlık değişimi telemetrisini yüzeye çıkarır. Mühendislik ekipleri, altyapı olarak kod veya olay odaklı sunucusuz kancalar aracılığıyla otomatik örnek değiştirme iş akışlarını tetikleyerek bu yerel olaylardan yararlanabilir.
AWS, bu otomatik konteyner sağlığı özelliğinin tüm standart AWS Ticari Bölgelerinde ve AWS GovCloud (US) Bölgelerinde ek bir maliyet olmaksızın hemen kullanılabilir olduğunu onayladı. Kuruluşlar, izleme eşiklerini yapılandırmak ve yeni sağlık sinyallerini kurumsal uyarı sistemlerine entegre etmek için resmi teknik belgeleri inceleyebilir.
Kaynak: Orijinal Makale





