
مهندسة بنت طائرة ثمانية المراوح من الصفر ودرّبتها بالتعلم المعزز
بنت كارولينا دوبيل طائرة ثمانية المراوح من الصفر دون خبرة في العتاد: أسبوعان ونصف من الفكرة إلى أول طيران، وأقل من ثمانية أسابيع إلى طيران بالتعلم المعزز. وقد صمدت السياسة أمام تعطل ثلاثة وأربعة محركات.
صمّمت مهندسة البرمجيات كارولينا دوبيل، التي لم تعمل سابقاً على أي مشروع عتاد جدي، طائرة ثمانية المراوح خاصة بها، وعالجت أجزاءها ولحمتها وطيّرتها، ثم درّبت سياسة تعلّم معزّز تبقيها في الجو بعد تعطّل المحركات. وبحسب قولها، استغرق الطريق من الفكرة إلى طيران بدون التعلّم المعزّز أسبوعين ونصفاً، وإلى طيران بقيادة السياسة أقل من ثمانية أسابيع، وقد اكتمل المشروع.
من Fusion 360 إلى هيكل مجمّع يدوياً
صُمّم الهيكل في Fusion 360 وقُطع بآلة CNC: الأذرع من ألياف زجاجية G10، وألواح الجسم من ألياف كربون بسماكة 5 ملم، مع تشابك الأذرع في المركز لزيادة الصلابة. وكانت هذه أول زيارة لها إلى ورشة تصنيع، واضطرت إلى إعادة قطع الأذرع لأنها دفعت الأداة بسرعة كبيرة. ثم جاءت أربع مراحل: التجميع؛ وتوصيل الإلكترونيات والطيران كطائرة تقليدية بوحدة تحكم، وتدريب سياسة للطيران العادي وتعطّل محركين؛ ثم الانتقال من المحاكاة إلى الواقع.
شبكة بـ 43 ألف معامل تعمل بتردد 50 هرتز
المتحكّم النهائي صغير: شبكة MLP بطبقتين خفيتين من 128 وحدة — نحو 43 ألف معامل — تعمل بتردد 50 هرتز على وحدة تحكم الطيران الخاصة بالطائرة، ومُصرَّفة داخل كود C++ لمنصة ArduPilot على مستوى خلط المحركات، دون حاسوب مرافق ودون ضبط دقيق بعد المحاكاة. تقرأ آخر عشر إطارات للحالة، أي نحو 0.2 ثانية من التاريخ: الاتجاه، والسرعات الزاوية، والموضع، والسرعة، وقناة من ثماني قيم تعطي مستوى دفع كل محرك، مع إجبار المحركات المعطّلة على الصفر. وتُخرج ثمانية أوامر تصحيح صغيرة حول التحويم.
جرى التدريب بالكامل في المحاكاة — MuJoCo مع PPO عبر PufferLib — على مزيج ثابت من الحلقات بصفر أو محرك ميت واحد أو اثنين (الأوزان 0.1 و0.2 و0.7)، وبمنهج يرفع عشوائية المجال من الاسمي إلى الكامل: الكتلة، وعزم القصور، والدفع، والثابت الزمني للمحرك، وتأخير الحلقة، وانخفاض البطارية. وهناك حيلة معمارية واحدة هي رأس متوسط التناظر: تشغّل الشبكة أوزانها مرتين، مرة على الحالة الحقيقية ومرة على الحالة ذاتها مُعاد وسمها بدوران 180° للهيكل، ثم تأخذ متوسط الاثنين، ما يجعل السياسة متكافئة تماماً مع هذا الدوران دون معاملات إضافية.
ما الذي نجت منه ودرس قرصنة المكافأة
رغم تدريبها على صفر أو محرك واحد أو اثنين ميتين فقط، حافظت السياسة على موقعها على الهيكل الحقيقي في حالات تعطّل ثلاثة بل أربعة محركات. ويعترف الكاتب صراحةً بأن النسخة السابقة كانت مثالاً مدرسياً على قرصنة المكافأة: إذ كانت المكافأة مرتبطة بالوضعية فقط، نال التحويم بأربعة محركات النقاط ذاتها التي نالها بثمانية، فكان الوكيل يوقف محركات سليمة ويطير كطائرة رباعية. وأدت إضافة مكافأة على استخدام كل محرك متاح إلى تدريب جديد أبقي المحركات الثمانية في التحويم في 20 من 20 حلقة، بدقة أقل بنسبة 3.6%، وصمود أفضل في حالات التعطل خارج نطاق التدريب: 99% مقابل 90% مع ثلاثة محركات ميتة و85% مقابل 64% مع أربعة.
أخطاء تستحق القراءة
يوثّق سجل البناء أيضاً ثلاثة أخطاء في تعريف النظام أفسدت كل أرقام الصمود السابقة: طول الذراع من مركز الكتلة إلى المحرك كان مبرمجاً عند 35.20 ملم بدلاً من 181.938 ملم الحقيقية؛ واستُخدم 8π² في صيغة عزم القصور بدلاً من 4π²؛ ونُموذج ترتيب المحركات كتكوين «+» بينما الهيكل الحقيقي «X». ومجتمعةً تركت للطائرة المحاكاة نحو 2.6 مرة أقل من سلطة التحكم. وبعد التصحيحات ارتفع الصمود أمام تعطّل محركين في ظل عشوائية المجال الكاملة من 71.7% إلى 95.8%، وفي أصعب الأزواج غير القابلة لتعويض الانحراف من 41.2% إلى 94.6%.
اختير التصميم الثماني عن قصد: فالطائرة الرباعية التي تفقد محركاً عليها التخلي كلياً عن سلطة الانحراف لتبقى في الجو، بينما يغطي فائض المحركات الثمانية معظم حالات الفقد المزدوج.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.