
AWS تنشر معمارية قائمة على الوكلاء للاستعلام عن محتوى الفيديو
نشرت مدونة AWS Machine Learning معمارية حل يجيب عن أسئلة باللغة الطبيعية حول مقاطع الفيديو المرفوعة ويقدم إجابات بطوابع زمنية، بالاعتماد على Amazon Bedrock وAmazon Rekognition وAmazon Transcribe.
تسجّل فرق الإعلام والأمن والتأمين والخدمات المهنية كميات من الفيديو أكبر بكثير مما تستطيع مشاهدته: تتراكم تسجيلات الاجتماعات على الأقراص المشتركة، وتلتقط الكاميرات أسابيع من المشاهد دون مراجعة. والمعلومات الموجودة داخلها — قرار اتُّخذ قبل أسابيع أو اللحظة التي وصل فيها شخص إلى الباب — لا يمكن عادةً الوصول إليها إلا بمشاهدة ساعات من المحتوى.
نشرت مدونة AWS Machine Learning معمارية حل يجعل هذا المحتوى قابلاً للاستعلام باللغة الطبيعية. يرفع المستخدم تسجيلاً ويطرح أسئلة مثل “ما القرارات التي اتُّخذت في هذا الاجتماع؟”، فيجيب النظام مع طوابع زمنية. ويُعاد المحتوى الذي جرى تحليله سابقاً في أقل من ثانية، بينما يستغرق التحليل الأول لفيديو جديد من 5 إلى 10 دقائق.
وكيل واحد بدلاً من مسارات ثابتة
يقوم التصميم على Strands Agents SDK. فبدلاً من مسار مُعدّ مسبقاً لكل نوع من الأسئلة — نسخ صوتي، بحث بصري، مطابقة وجوه — يقرر وكيل واحد وقت التشغيل الخدمات التي ينبغي استدعاؤها: أسئلة المحتوى المنطوق تذهب إلى Amazon Transcribe والأسئلة البصرية إلى Amazon Rekognition، مع Amazon Bedrock كطبقة للاستدلال. وتخزَّن النتائج في Amazon S3، ما يسمح بإعادة استخدام التحليل السابق في الأسئلة اللاحقة.
النتائج وحالات الاستخدام
تُعرض كل خدمة من خدمات AWS كدالة Python مزوّدة بالمزخرف @tool، ويوجّه الـ docstring الخاص بها النموذج إلى وقت استخدامها. وفي استعلام مطابقة الوجوه ينفّذ الوكيل خطوتين متتابعتين: فهرسة صورة مرجعية ثم البحث في المشاهد، ليعود بنتائج مقترنة بأزمنة محددة ودرجات ثقة.
وبحسب AWS، تبنّت شركة إعلام وترفيه هذا النهج خلال مشروع مع AWS Professional Services للاستعلام عن تسجيلات جلسات العمل. ووفق مقارنة داخلية لدى العميل، انخفض وقت المراجعة اليدوية بنحو 80% على مدى أكثر من 200 تسجيل متعدد الساعات؛ وتشير AWS إلى أن الرقم لم يُتحقق منه بشكل مستقل.
النشر والتكلفة والقيود
يعمل التنفيذ المرجعي على Amazon ECS مع AWS Fargate خلف موازن تحميل داخلي لا يمكن الوصول إليه إلا عبر Amazon CloudFront. والوصول بدعوة فقط، عبر حسابات Amazon Cognito مع مصادقة متعددة العوامل إلزامية؛ وتبقى الملفات المرفوعة في بادئات S3 خاصة بكل مستخدم بدورة حياة مدتها 24 ساعة.
يكلّف النسخ الصوتي لتسجيل مدته 60 دقيقة نحو 1.44 دولار، وكل سؤال إضافي 0.05–0.15 دولار، بينما يكلّف تحليل الوجوه أو العناصر نحو 6 دولارات مرة واحدة. وبما أن الوكيل يختار الأدوات من أوصافها، يمكن إضافة Amazon Textract أو AWS HealthScribe أو Amazon Comprehend كدوال جديدة دون تغيير سير العمل.
SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي
نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.