უკან დაბრუნება
GitHub Actions-სა და Pages-ს საათობრივი შეფერხება ჰქონდა
SiTech Team2 წთ. საკითხავი

GitHub Actions-სა და Pages-ს საათობრივი შეფერხება ჰქონდა

რუტინულმა შიდა დეპლოიმენტმა 6 აგვისტოს სამუშაო პროცესების ჩავარდნები და შეფერხებები გამოიწვია; პიკზე Actions-ის გაშვებების 71 პროცენტს ინფრასტრუქტურული ხარვეზი ჰქონდა, აცხადებს GitHub-ის ანგარიში.

GitHub Actions 2026 წლის 6 აგვისტოს უმეტეს ნაწილში შეფერხებით მუშაობდა: სამუშაო პროცესები ვერ იშვებოდა ან დიდხანს რჩებოდა რიგში, ხოლო გავლენა GitHub Pages-ზე, Copilot-ის ფუნქციებსა და საწარმოო მიგრაციის ხელსაწყოებზეც გავრცელდა. GitHub-ის სტატუსის გვერდზე ინციდენტი 6 აგვისტოს 15:05 UTC-დან მომდევნო დღის 00:14 UTC-მდე დაფიქსირდა.

რა მოხდა

GitHub-ის ანგარიშის მიხედვით, გამომწვევი მიზეზი რუტინული დეპლოიმენტი იყო შიდა Actions სერვისზე, რომელიც მოვლენებს ამუშავებს და დავალებებს ქმნის. დეპლოიმენტმა არსებული სიმძლავრისა და პარალელიზმის სისუსტე გამოაჩინა: pod-ების ჩანაცვლებისას დარჩენილი სიმძლავრე გადაიტვირთა, სერვისები ჩამოიშალა და ხარვეზი რამდენიმე კლასტერსა და დამკვიდრებულ სერვისებზე გავრცელდა. პიკის მომენტში სამუშაო პროცესების 71 პროცენტს ინფრასტრუქტურული ხარვეზები ჰქონდა, დანარჩენების 75 პროცენტი კი ხუთ წუთზე მეტით იყო დაგვიანებული. დაზარალდა როგორც GitHub-ის, ისე საკუთარ (self-hosted) runner-ებზე მომუშავე მომხმარებლები.

მეორე ხარვეზი და საათობრივი დათრგუნვა

ინჟინერებმა სიმძლავრე გაზარდეს, webhook-ებით გამოწვეული სამუშაო დროებით შეაფერხეს, რომ სისტემას აღდგენის საშუალება მისცემოდა, და დაგროვილი დავალებებისთვის დამატებითი რესურსი გამოყვეს; ძირითადი სერვისები დაახლოებით 17:00 UTC-ზე დაბრუნდა. მანამდე უკვე გამოჩნდა მეორე პრობლემა: დავალებების განაწილების სერვისში ლატენტურმა შეცდომამ გამოიწვია, რომ runner-ებს უკვე ბათილი დავალებები გადაეცათ და ისინი მათ ხელახლა ცდაზე იჭერდნენ. ყველაზე ცუდ მომენტში რიგში მყოფი დავალებების დაახლოებით 30-40 პროცენტი სრულდებოდა; შესწორებების შემდეგ ახალი workflow-ების წარმატების მაჩვენებელი 97-მდე, შემდეგ კი 99 პროცენტამდე ავიდა და დაგროვილი რიგები ღამით დაიცალა.

შედეგები

აღდგენამ ბოლო წვრილმანებიც მოიცავდა. Actions Runner Controller-ის ზოგიერთი pod უმოქმედო მდგომარეობაში ჩარჩა და ხელით აღდგენა დასჭირდა — ინციდენტის დროს გამოყენებული ცვლილება უკან გაბრუნდა, ავტომატური აღდგენა კი Runner-ისა და ARC-ის მომავალ ვერსიებშია დაგეგმილი. GitHub ასევე აფრთხილებს, რომ ინციდენტის დროს დაკარგული push- და pull request მოვლენები ავტომატურად ვერ აღდგება — ზოგიერთი workflow ხელით უნდა გაეშვას. განმეორების თავიდან ასაცილებლად კომპანია აუმჯობესებს დეპლოიმენტისა და სიმძლავრის კონტროლს, ინციდენტამდელი პირობების მონიტორინგს და რიგებში მყოფი სამუშაოსა თუ დავალებების განაწილების მედეგობას.

SSiTech

SiTech — AI-გაძლიერებული ვებ დეველოპმენტი

ვქმნით სწრაფ, თანამედროვე ვებსაიტებს და AI-ს ვაერთიანებთ ქართული ბიზნესებისთვის. გაქვთ პროექტი ან კითხვა? სიამოვნებით დაგეხმარებით.