العودة
Ai2 تطلق نموذج AstaBrief 8B مفتوح الأوزان: يُعدّ التقارير العلمية أسرع بـ 3.5 مرة
SiTech AI Team2 دقيقة قراءة

Ai2 تطلق نموذج AstaBrief 8B مفتوح الأوزان: يُعدّ التقارير العلمية أسرع بـ 3.5 مرة

أطلق معهد ألين للذكاء الاصطناعي (Ai2) نموذج AstaBrief 8B مفتوح الأوزان: يُنشئ تقارير مُستشهد بها من أسئلة البحث والأدبيات المُستخرجة، ويعمل في Fast mode بمتوسط 51,1 ثانية، أسرع بـ 3,5 مرة من Thinking mode.

أطلق معهد ألين للذكاء الاصطناعي (Ai2) في 2 أكتوبر نموذج AstaBrief 8B مفتوح الأوزان. يُنشئ النموذج تقارير مُستشهد بها من أسئلة البحث ومقاطع الأدبيات المُستخرجة، ويعمل بالفعل في Asta بوضع Fast mode مع Thinking mode.

في خط الأنابيب الكامل، يُعدّ Fast mode تقريرًا واحدًا بمتوسط 51,1 ثانية، مقابل 178,5 ثانية لـ Thinking mode، أي أسرع بحوالي 3,5 مرة. يكتب النموذج التقرير في تمريرة واحدة ويتخطى مراحل التلخيص والتجميع؛ وبحسب Ai2، لم تتأثر الجودة.

نموذج مفتوح للتقارير العلمية

AstaBrief 8B هو نموذج بثمانية مليارات معامل مبني على Qwen3-8B. عمل باحثو Ai2 بشكل أساسي على بيانات ما بعد التدريب والتقييم. تتيح الأوزان المفتوحة للمؤسسات تشغيل النموذج على بنيتها التحتية الخاصة خلف جدار الحماية، وهو أمر مهم للأبحاث الحساسة.

كيف تم تدريب النموذج

تم تدريب AstaBrief على مرحلتين: supervised fine-tuning (SFT) و direct preference optimization (DPO). اختارت Ai2 مسارًا أبسط بدلًا من أسلوب RL المكلف وغير المستقر. أُخذت أسئلة التدريب من سجلات مستخدمين حقيقيين: وبعد التصفية بقي 90 ألف سؤال بحثي.

لمرحلة SFT، أنشأ خط أنابيب ScholarQA التقارير المستهدفة (Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, GPT-4.1)؛ وبعد التصفية بقي 47 ألف مثال. ولمرحلة DPO، قارن نموذجان قضاة الأزواج (GPT-4.1 و DeepSeek-R1)، وبلغ عدد الأمثلة في المجموعة النهائية نحو 6 آلاف. من بين أربعة فلاتر إحصائية، حقق استبعاد الأمثلة ذات كثافة الاستشهادات المنخفضة أكبر مكسب.

النتائج والاستخدام

كان الهدف الرئيسي للتقييم هو SQABench-CS2: 200 سؤال من علوم الحاسوب. قُيّمت درجة المعيار، دقة الإجابة، دقة الاستشهادات والصحة؛ بالإضافة إلى ذلك تم الاختبار على DeepScholarBench (63 سؤالًا) وإجراء دراسة بشرية من 14 سؤالًا.

جدول نتائج AstaBrief

AstaBrief تنافسي مقارنةً بخط أنابيب مبني على Claude و DR Tulu. في الدراسة البشرية، يتفوق DR Tulu إجمالًا، إلا أن باحثين من أصل ثلاثة منحوا AstaBrief الأفضلية في دقة الاستشهادات. تشير Ai2 إلى أن التقييم أُجري أساسًا في عام 2025 ولم يُكرَّر مع النماذج الحالية.

مقارنة مُقيّمة بنماذج لغوية

الاستخدام المبكر إيجابي: جرّب Fast mode 374 مستخدمًا، 29,1% منهم يستخدمونه يومين أو أكثر، ويُنشئون بمتوسط 3,67 سلسلة تقارير. فضّل 23% البقاء على Fast mode، بينما انتقل 18% بين الوضعين وقضى 40% من السلاسل في Fast mode. التغذية الراجعة الإيجابية متشابهة في كلا الوضعين: 84,2% لـ Fast mode و 85,2% لـ Thinking mode.

SSiTech

SiTech — تطوير ويب مدعوم بالذكاء الاصطناعي

نبني مواقع سريعة وعصرية وندمج الذكاء الاصطناعي في سير عمل الشركات. لديك مشروع أو سؤال؟ يسعدنا مساعدتك.