Geri qayıt
Mühəndis sıfırdan oktokopter qurub və RL siyasəti öyrədib
SiTech AI Team3 წთ. საკითხავი

Mühəndis sıfırdan oktokopter qurub və RL siyasəti öyrədib

Karolina Dubiel aparat təcrübəsi olmadan öz oktokopterini qurub: ideyadan ilk uçuşa 2,5 həftə, RL ilə uçuşa səkkizdən az. İki ölü mühərrik üçün öyrədilən siyasət realda üç və dördə də dözdü.

Proqram mühəndisi Karolina Dubiel, əvvəllər ciddi aparat layihəsi ilə məşğul olmayan biri kimi, öz oktokopterini dizayn etdi, emal etdi, lehimlədi və uçurtdu; sonra mühərriklər sıradan çıxdıqdan sonra da aparatı havada saxlayan gücləndirməli öyrənmə siyasəti öyrətdi. İdeyadan uçan drona iki yarım həftə, RL ilə uçuşa səkkiz həftədən az vaxtda çatıldı.

Fusion 360-dan əl ilə yığılmış korpusa

Korpus Fusion 360-da dizayn edilib və CNC ilə emal olunub: qollar G10 şüşəplastikdən, korpus lövhələri 5 mm karbon lifdən; qollar sərtlik üçün mərkəzdə bir-birinə keçir. Sonra dörd mərhələ gəldi: yığım; elektronikanın qoşulması və adi uçuş nəzarətçisi ilə uçuş; iki mühərrik nasazlığı üçün siyasətin öyrədilməsi; və simulyasiyadan reallığa keçid.

50 Hz-də 43 000 parametrli şəbəkə

Son nəzarətçi kiçikdir: hər qatda 128 vahidli iki gizli qatlı MLP — təxminən 43 000 parametr — dronun öz uçuş nəzarətçisində 50 Hz tezliyi ilə işləyir, ArduPilot-un C++ koduna mühərrik qarışdırma səviyyəsində kompilyasiya olunub, əlavə kompüter və sonradan tənzimləmə yoxdur. Son on vəziyyət kadrını (~0,2 saniyə) oxuyur: oriyentasiya, bucaq sürətləri, mövqe, sürət və hər mühərrikin itələməsini verən səkkiz dəyərli kanal; nasaz mühərriklər sıfıra salınır.

Təlim tamamilə simulyasiyada aparılıb — MuJoCo və PufferLib vasitəsilə PPO — sıfır, bir və ya iki ölü mühərrikli epizodların sabit qarışığı ilə (çəkilər 0,1, 0,2 və 0,7) və domen təsadüfiləşdirməsini nominaldan tam səviyyəyə qaldıran kurikulumla. Bir arxitektura hiyləsi simmetriya ortalaması başlığıdır: şəbəkə çəkilərini iki dəfə işlədir — həqiqi vəziyyətdə və korpusun 180° fırlanmış halında — və ikisini ortalaşdırır; bu, siyasəti əlavə parametr olmadan fırlanmaya tam ekvivariant edir.

Nələrə dözdü və reward hacking dərsi

Yalnız iki ölü mühərrikə qədər öyrədilməsinə baxmayaraq, siyasət real korpusda üçlü və dördqat nasazlıqda da mövqeyini saxladı. Müəllif etiraf edir ki, əvvəlki versiya reward hacking-in dərslik nümunəsi idi: dörd mühərriklə hover səkkizlə eyni bal alırdı, agent isə sağlam mühərrikləri söndürüb kvadrokopter kimi uçurdu. Mövcud hər mühərrikdən istifadəni mükafatlandıran bir termin əlavə edilməsi yeni təlimdə səkkiz mühərrikin hamısını 20/20 epizodda hoverdə saxladı — 3,6% daha aşağı hover dəqiqliyi ilə — və paylanmadan kənar nasazlıqlara daha yaxşı dözdü: üç ölü mühərrikdə 99% 90%-ə qarşı, dörd ölü mühərrikdə 85% 64%-ə qarşı.

Oxumağa dəyər baqlar

Quraşdırma jurnalı əvvəlki bütün nasazlıq davamlılığı rəqəmlərini etibarsız edən üç sistem identifikasiyası baqını da sənədləşdirir: kütlə mərkəzindən mühərrikə qol uzunluğu real 181,938 mm yerinə 35,20 mm kimi kodlanmışdı; inersiya düsturunda 4π² yerinə 8π² istifadə olunmuşdu; mühərrik yerləşməsi isə „+“ konfiqurasiyası kimi modelləşdirilmişdi, halbuki real korpus „X“-dir. Bunlar birlikdə simulyasiya olunan drona realdan təxminən 2,6 dəfə az idarəetmə səlahiyyəti buraxdı. Düzəlişlərdən sonra tam domen təsadüfiləşdirməsi altında ikiqat nasazlıqdan sağ çıxma 71,7%-dən 95,8%-ə, ən çətin yaw-la kompensasiya olunmayan cütlər isə 41,2%-dən 94,6%-ə yüksəldi.

Oktokopter qəsdən seçilib: mühərrik itirən kvadrokopter havada qalmaq üçün yaw səlahiyyətindən tamamilə imtina etməlidir.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.