
Ai2 açıq çəki modeli AstaBrief 8B-ni buraxdı: elmi hesabları 3,5 dəfə sürətlə hazırlayır
Ai2 (Allen Institute for AI) açıq çəki modeli AstaBrief 8B-ni buraxdı: o, tədqiqat sualından və tapılmış ədəbiyyatdan sitatlanmış hesab hazırlayır və Fast mode-da ortaqla 51,1 saniyədə işləyir, Thinking mode-dan 3,5 dəfə sürətlə.
Allen Institute for AI (Ai2) 2 oktyabrda açıq çəki modeli AstaBrief 8B-ni buraxdı. Model tədqiqat sualı və tapılmış ədəbiyyat parçalarından sitatlanmış hesab hazırlayır və Asta-da artıq Fast mode kimi, Thinking mode ilə yanaşı işləyir.
Tam pipeline-də Fast mode bir hesabı ortaqla 51,1 saniyədə hazırlayır, Thinking mode-un 178,5 saniyəsinə qarşı, yəni təxminən 3,5 dəfə sürətlə. Model hesabı bir keşdə yazır və xülasələmə və klasterləşmə mərhələlərini ötürür; Ai2-nin sözlərinə görə, keyfiyyət zərər çəkmədi.
Açıq model elmi hesablar üçün
AstaBrief 8B Qwen3-8B bazasında səkkiz milyard parametrlidir. Ai2-nin araşdırıcıları əsasən post-training məlumatları və qiymətlərmə ilə işlədilər. Açıq çəkilər institutlara modeli öz infrastrukturunda, firewall arxasında işə salmağa imkan verir, bu da həssas tədqiqatlar üçün vacibdir.
AstaBrief iki mərhələdə təlim verildi: supervised fine-tuning (SFT) və direct preference optimization (DPO). Ai2 bahalı və qeyri-sabit RL yanaşması əvəzinə daha sadə yol seçdi. Tapşırıq sualları real istifadəçi loglarından götürüldü: filtrləmədən sonra 90 min tədqiqat sualı qaldı.
SFT üçün hədəf hesabları ScholarQA pipeline-i yaradıb (Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, GPT-4.1); filtrləmədən sonra 47 min nümunə qaldı. DPO üçün cütləri iki hakim model müqayisə edirdi (GPT-4.1 və DeepSeek-R1), final dəstərdə isə 6 minə qədər nümunə var. Dörd statistik filtrdən ən çox qazanc aşağı sitat sıxlığı olan nümunələrin çıxarılması ilə əldə edildi.
Nəticələr və tətbiq
Qiymətlərmənin əsas hədəfi SQABench-CS2 idi: 200 sual kompüter elmlərindən. Rubrik balı, cavab dəqiqliyi, sitat dəqiqliyi və səhvlik ölçüldü; əlavə olaraq DeepScholarBench-də (63 sual) yoxlanıldı və 14 suallıq insan tədqiqatı aparıldı.

AstaBrief Claude-ə əsaslanan pipeline və DR Tulu ilə rəqabətidir. İnsan tədqiqatında ümumi üstünlüyü DR Tulu qazanır, lakin üç araşdırcıdan ikisi sitat dəqiqliyində AstaBrief üstünlüyünü verdi. Ai2 qiymətlərmənin əsasən 2025-ci ildə aparıldığını və müasir modellərlə təkrarlanmadığını qeyd edir.

Erkən istifadə müsbətdir: Fast mode-u 374 istifadəçi sınadı, 29,1% onu iki və ya daha çox gün istifadə edir, ortaqla 3,67 hesab thread yaradır. 23% Fast mode-da qalmağı üstün tutub, 18% rejimlər arasında keçir və thread-lərin 40% Fast mode-da keçirilib. Müsbət rəy hər iki rejimdə oxşardır: Fast mode üçün 84,2% və Thinking mode üçün 85,2%.
SiTech — AI ilə gücləndirilmiş veb hazırlanması
Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.