
وكلاء AI للطائرات المسيّرة: ما يعمل اليوم وما لا يزال بحثًا
يشرح تحليل تقني نُشر على HackerNoon كيف تُبحر الطائرات المسيّرة بنفسها: الطبقة الكلاسيكية من SLAM وVIO وPX4، وطبقة الوكلاء المبنية على النماذج الأساسية، والقيود التي تُبقي الاستقلالية الوكيلية في مرحلة البحث.
قطعت التقنية الذاتية شوطًا كبيرًا خلال خمس سنوات: استثمرت Tesla وBYD وWaymo مليارات الدولارات في السيارات ذاتية القيادة، لكن معظم عمليات النشر لا تزال محدودة بمناطق جغرافية. يقول مؤسس Falcon Eye AI، Vishwa Vimukthi Gammuduwaththage، في تحليل نُشر على HackerNoon في 23 سبتمبر إن جزءًا كبيرًا من طبقة الإدراك والتحكم هذه ينتقل أيضًا إلى الطائرات المسيّرة.
ويفصل التحليل بين الطبقة الكلاسيكية التي تطير فعلاً اليوم وطبقة "وكيل الذكاء الاصطناعي" التي لا تزال بحثية جزئيًا.
أربعة عصور لملاحة الطائرات المسيّرة
مرّت الملاحة بأربع مراحل: التحكم اليدوي ضمن خط النظر؛ الطيران وفق نقاط مسار مدعومة بـGPS؛ دمج المستشعرات لفهم كامل للوضع؛ والاستقلالية المدفوعة بالذكاء الاصطناعي. القفزة الحاسمة هي المرحلة الأخيرة: جعل GPS الطائرات قابلة للبرمجة، وجعلها الذكاء الاصطناعي قابلة للتكيّف. أهم المهام — داخل المباني، تحت الجسور، في الممرات الحضرية أو في بيئات التشويش — تُنفَّذ بلا GPS، وهناك تحديدًا تُثبت طبقة الرؤية والذكاء الاصطناعي قيمتها.
الطبقة الكلاسيكية التي تطير فعلاً
ينقسم النظام العملي إلى أربع طبقات: الإدراك، والمعالجة على المتن، والتحكم بالطيران، والاتصال. تمنح الكاميرات المجسمة العمق، وتوفر وحدات IMU بيانات الحركة عالية التردد، ويبلغ GPS مع تصحيحات RTK دقة سنتيمترية. تبني SLAM خريطة للبيئة في الزمن الحقيقي وتتتبع موقع الطائرة؛ ويدمج التتبع البصري-القصوري (VIO) بيانات الكاميرا وIMU عند انقطاع GPS. يتولى التعلم العميق الإدراك، ويحسّن التعلم المعزز سياسة الملاحة؛ ويعتمد تخطيط المسار على A* وRRT وPRM. يعتمد التحكم بالطيران على إطارين مفتوحين ناضجين هما PX4 وArduPilot، مع نقل الأوامر والقياس عن بعد عبر MAVLink.
ماذا يعني «وكيل AI» اليوم
كل ما سبق هو استقلالية كلاسيكية، ولا تزال الجواب الصحيح لمعظم المهام التجارية. لكن الحدود انتقلت إلى أنظمة مبنية على النماذج الأساسية. تتيح الملاحة البصرية-اللغوية (VLN) للطائرة تنفيذ تعليمة مثل «حلّق فوق المبنى الأحمر ثم انعطف يسارًا عند التقاطع» اعتمادًا على المشاهدات البصرية فقط؛ وقد أظهر معيار AerialVLN، المبني على عشرات الآلاف من أزواج التعليمات والمسارات، أن أساليب VLN الداخلية تنتقل بشكل سيئ إلى المشاهد الجوية. تولّد نماذج الرؤية-اللغة-الفعل (VLA) مثل OpenVLA وπ0 تحكمًا منخفض المستوى من طرف إلى طرف، بينما يربط AutoFly وGRaD-Nav++ الأوامر عالية المستوى بالتحكم على المتن.
أين يتعثر هذا حتى الآن
يضبط الكاتب التوقعات. نموذج يفكر بتردد 2 هرتز لا يمكنه أن يحل محل تجنب الاصطدام الذي يجب أن يعمل بتردد 50 هرتز، لذا فالواقع القريب هجين: نموذج أساسي للتفكير فوق متحكم كلاسيكي سريع للردود الفورية. الحوسبة على المتن سقف صارم — كل غرام من GPU وكل واط يستهلكه هو وقت طيران لم يُنفق. لا توجد بعد قصة لضمان السلامة مع النماذج الأساسية: يمكن اعتماد متحكم حتمي، لكن تعداد أنماط فشل سياسة عصبية كبيرة يبقى مشكلة تنظيمية مفتوحة. تبقى المحاكاة (Gazebo وAirSim) والاختبارات المرحلية — من التثبيت بالحبل إلى الجو المفتوح — الانضباط الذي يكسب الثقة. الموقف الصادق، وفق الكاتب، طبقي: طبقة كلاسيكية للردود والسلامة، ونماذج أساسية للتفكير.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.