
הבינה המלאכותית מטפלת בתקלות, והמהנדסים מאבדים מגע עם המערכות
אוטומציה של תגובה לאירועים פותרת התראות שגרתיות ביעילות כזו שהמהנדסים מתאמנים פחות על המערכות שלהם — פרדוקס שחוקרת הגורם האנושי ליזאן ביינברידג' תיארה כבר ב-1983.
כלי תגובה לאירועים מבוססי בינה מלאכותית, המכונים לרוב "AI SRE", יודעים לבדוק התראות, לגבש השערות, לשאול טלמטריה, להצליב פריסות אחרונות ולעיתים אף ליישם את התיקון בעצמם. בפוסט בבלוג טוען סילבן קלאש, ראש AI Labs בחברת Rootly, שלהתקדמות הזו יש מחיר: המהנדסים מאבדים מגע עם המערכות שהם אחראים עליהן.
אירועים שגרתיים הם מקור האינטואיציה
קלאש, לשעבר SRE בלינקדאין ומייסד שותף של Holberton School, כותב שפתרון אוטומטי של התראות שגרתיות שלל מהמגיבים האנושיים את התרגול שהם זקוקים לו. דווקא באירועים שגרתיים מהנדסים מפתחים אינטואיציה לגבי האופן שבו המערכות שלהם מתנהגות ונכשלות. כשמגיע אירוע קשה שטרם נראה בעבר והאוטומציה אינה מצליחה לפתור אותו, המגיבים יהיו חייבים להשתלט עליו עם פחות תרגול משהיה להם קודם.
הוא מצטט את חוקרת הגורם האנושי ליזאן ביינברידג', שמאמרה מ-1983 "האירוניות של האוטומציה" תיאר את הפרדוקס: האוטומציה מצמצמת את ההזדמנויות של מפעילים לתרגל עבודה שגרתית, אך מותירה עליהם אחריות למצבים חריגים, ולכן הם זקוקים ליותר מיומנות והכשרה מבעבר. קלאש חוזה שה-MTTR הממוצע של רוב האירועים יירד, אבל זמן הפתרון של אירועים מורכבים יעלה, משום שהמגיבים איבדו מגע עם המערכות.
מה עושה התעופה עם תקלות נדירות
התעופה מציעה מודל. האוטומציה מבצעת חלק ניכר מהטיסה, אך הטייסים נותרים אחראים לכשל מנוע, למכשירים לא אמינים, להמראה שנקטעה ולמצבי הזדקרות. מנועי טורבינה מודרניים רושמים פחות מהפסקת מנוע אחת בטיסה לכל 100,000 שעות טיסה — נדיר עד כדי כך שטייס מסחרי עשוי להשלים קריירה שלמה בלי לחוות מקרה כזה מחוץ לסימולטור. לפי כללי ה-FAA, קברניטים חייבים לעבור הכשרה חוזרת או מבחן כשירות כל שישה חודשים, כולל תרחיש של כשל מנוע בהמראה. מחיר אובדן המיומנות ניכר בתאונות: בטיסה 235 של TransAsia Airways הצוות זיהה בטעות את המנוע התקול, והמטוס התרסק 117 שניות בלבד אחרי ההתראה הראשונה.
סימולציות, מאמנים ו"חוב ההבנה"
המעסיק של קלאש, חברת ניהול האירועים Rootly, שיתף פעולה עם Uptime Labs כדי ליישם את הרעיון בסימולציות אירועים מציאותיות: מהנדסים תופסים את כיסא מפקד האירוע בזמן תקלת מסחר אלקטרוני מדומה, משתמשים בכלי ניטור ומתאמים עם בעלי עניין מבוססי LLM בסלאק. הבינה המלאכותית יכולה לשמש גם כמאמנת — מגיב יכול לבקש מהסוכן להסביר אילו צעדים נקט, אילו אותות בדק ואילו ראיות עומדות מאחורי האבחון. אך הסבר ותצפית אינם תחליף לתרגול, מתעקש קלאש ומשווה זאת ללימוד טניס בצפייה בלבד.
מסקנתו היא שצוותי הנדסה עלולים לצבור "חוב הבנה": פער הולך וגדל בין האופן שבו המערכות שלהם פועלות לרמת ההבנה של המגיבים. תרגול קבוע על המערכת, התמודדות עם תקלות לא מוכרות, תרגילי שולחן והנדסת כאוס צריכים להיות חלק ממוכנות הכוננות, ולא תוספת אופציונלית.
SiTech — פיתוח אתרים בכוח ה-AI
אנחנו בונים אתרים מהירים ומודרניים ומשלבים AI בתהליכי עבודה אמיתיים. יש לכם פרויקט או שאלה? נשמח לעזור.