Geri Dön
Olayları yapay zeka çözüyor, mühendisler sistemlerle bağını kaybediyor
SiTech AI Team2 წთ. საკითხავი

Olayları yapay zeka çözüyor, mühendisler sistemlerle bağını kaybediyor

Olay müdahalesini otomatikleştiren araçlar rutin uyarıları o kadar güvenilir çözüyor ki mühendisler kendi sistemleriyle daha az pratik yapıyor; uzmanlar bu paradoksa 1983'te dikkat çekmişti.

Yapay zeka destekli olay müdahale araçları — yaygın adıyla "AI SRE"ler — uyarıları inceleyebiliyor, hipotez kurabiliyor, telemetriyi sorgulayabiliyor, son dağıtımları ilişkilendirebiliyor ve bazen düzeltmeyi kendileri uygulayabiliyor. Rootly'nin AI Labs lideri Sylvain Kalache bir blog yazısında bu ilerlemenin bir bedeli olduğunu savunuyor: mühendisler, sorumlu oldukları sistemlerle bağlarını kaybediyor.

Rutin olaylar sezgiyi inşa ediyor

LinkedIn'de eski bir SRE ve Holberton School'un kurucu ortaklarından olan Kalache, rutin uyarıların otomatik çözülmesinin insan müdahaleciye gereken pratiği elinden aldığını yazıyor. Mühendisler, sistemlerinin nasıl davrandığına ve nasıl bozulduğuna dair sezgiyi tam da rutin olaylarda geliştiriyor. Otomasyonun çözemeyeceği, daha önce hiç görülmemiş zor bir olay geldiğinde ise müdahaleci devralmak zorunda kalacak — ama öncekinden daha az pratikle.

İnsan faktörleri araştırmacısı Lisanne Bainbridge'in 1983 tarihli "Otomasyonun İronileri" makalesine atıf yapıyor: otomasyon, operatörlerin rutin işi pratik etme fırsatını azaltırken anormal durumların sorumluluğunu yine onlarda bırakır, dolayısıyla operatörlerin otomasyondan öncekinden daha fazla beceriye ve eğitime ihtiyacı olur. Kalache'ye göre çoğu olayda ortalama MTTR düşecek, ancak karmaşık olaylarda çözüm süresi artacak; çünkü müdahaleciler sistemleriyle teması kaybetmiş olacak.

Havacılık nadir arızalar için ne yapıyor

Havacılık bir model sunuyor. Otomasyon uçuşun büyük kısmını üstleniyor, fakat pilotlar motor arızası, güvenilmez göstergeler, iptal edilen kalkış ve stall durumlarından sorumlu kalmaya devam ediyor. Modern türbin motorlarında 100.000 motor uçuş saatinde birden az uçuş içi durma yaşanıyor — bu o kadar nadir ki bir ticari pilot, simülatör dışında böyle bir olayla hiç karşılaşmadan kariyerini tamamlayabilir. ABD FAA kurallarına göre kaptanlar, kalkış sırasında motor arızası dahil senaryolarla altı ayda bir tekrarlı eğitim veya yeterlilik kontrolünden geçmek zorunda. Bu becerinin kaybının bedeli kazalarda görünüyor: TransAsia Airways'in 235 seferinde mürettebat hangi motorun arızalandığını yanlış tespit etti ve uçak ilk uyarıdan 117 saniye sonra düştü.

Simülasyonlar, eğitmenler ve "anlama borcu"

Kalache'nin çalıştığı olay yönetimi şirketi Rootly, bu fikri Uptime Labs ile gerçekçi olay simülasyonlarına dönüştürdü: mühendisler simüle edilmiş bir e-ticaret kesintisinde olay komutanı koltuğuna oturuyor, gözlemlenebilirlik araçlarını kullanıyor ve Slack'te LLM tabanlı paydaşlarla koordinasyon sağlıyor. Yapay zeka bir eğitmen olarak da işe yarıyor — müdahaleci, ajanın hangi adımları attığını, hangi sinyalleri incelediğini ve teşhisini hangi kanıta dayandırdığını sorabiliyor. Ancak Kalache, açıklamanın ve gözlemin pratiğin yerini tutmadığında ısrarlı: tenis izleyerek değil, sahaya çıkarak öğrenilir.

Vardığı sonuç şu: mühendislik ekipleri "anlama borcu" biriktirme riski taşıyor — sistemlerinin nasıl çalıştığı ile müdahalecilerin onları ne kadar iyi anladığı arasındaki açılan mesafe. Sisteme düzenli elle müdahale, bilinmeyen arızalarla uğraşma, masaüstü tatbikatları ve kaos mühendisliği, isteğe bağlı ekler değil nöbet hazırlığının parçası olarak görülmeli.

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.