Geri qayıt
Ai2 açıq çəki modeli AstaBrief 8B-ni buraxdı: elmi hesabları 3,5 dəfə sürətlə hazırlayır
SiTech AI Team2 dəq oxu

Ai2 açıq çəki modeli AstaBrief 8B-ni buraxdı: elmi hesabları 3,5 dəfə sürətlə hazırlayır

Ai2 (Allen Institute for AI) açıq çəki modeli AstaBrief 8B-ni buraxdı: o, tədqiqat sualından və tapılmış ədəbiyyatdan sitatlanmış hesab hazırlayır və Fast mode-da ortaqla 51,1 saniyədə işləyir, Thinking mode-dan 3,5 dəfə sürətlə.

Allen Institute for AI (Ai2) 2 oktyabrda açıq çəki modeli AstaBrief 8B-ni buraxdı. Model tədqiqat sualı və tapılmış ədəbiyyat parçalarından sitatlanmış hesab hazırlayır və Asta-da artıq Fast mode kimi, Thinking mode ilə yanaşı işləyir.

Tam pipeline-də Fast mode bir hesabı ortaqla 51,1 saniyədə hazırlayır, Thinking mode-un 178,5 saniyəsinə qarşı, yəni təxminən 3,5 dəfə sürətlə. Model hesabı bir keşdə yazır və xülasələmə və klasterləşmə mərhələlərini ötürür; Ai2-nin sözlərinə görə, keyfiyyət zərər çəkmədi.

Açıq model elmi hesablar üçün

AstaBrief 8B Qwen3-8B bazasında səkkiz milyard parametrlidir. Ai2-nin araşdırıcıları əsasən post-training məlumatları və qiymətlərmə ilə işlədilər. Açıq çəkilər institutlara modeli öz infrastrukturunda, firewall arxasında işə salmağa imkan verir, bu da həssas tədqiqatlar üçün vacibdir.

AstaBrief iki mərhələdə təlim verildi: supervised fine-tuning (SFT) və direct preference optimization (DPO). Ai2 bahalı və qeyri-sabit RL yanaşması əvəzinə daha sadə yol seçdi. Tapşırıq sualları real istifadəçi loglarından götürüldü: filtrləmədən sonra 90 min tədqiqat sualı qaldı.

SFT üçün hədəf hesabları ScholarQA pipeline-i yaradıb (Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, GPT-4.1); filtrləmədən sonra 47 min nümunə qaldı. DPO üçün cütləri iki hakim model müqayisə edirdi (GPT-4.1 və DeepSeek-R1), final dəstərdə isə 6 minə qədər nümunə var. Dörd statistik filtrdən ən çox qazanc aşağı sitat sıxlığı olan nümunələrin çıxarılması ilə əldə edildi.

Nəticələr və tətbiq

Qiymətlərmənin əsas hədəfi SQABench-CS2 idi: 200 sual kompüter elmlərindən. Rubrik balı, cavab dəqiqliyi, sitat dəqiqliyi və səhvlik ölçüldü; əlavə olaraq DeepScholarBench-də (63 sual) yoxlanıldı və 14 suallıq insan tədqiqatı aparıldı.

AstaBrief nəticələrinin cədvəli

AstaBrief Claude-ə əsaslanan pipeline və DR Tulu ilə rəqabətidir. İnsan tədqiqatında ümumi üstünlüyü DR Tulu qazanır, lakin üç araşdırcıdan ikisi sitat dəqiqliyində AstaBrief üstünlüyünü verdi. Ai2 qiymətlərmənin əsasən 2025-ci ildə aparıldığını və müasir modellərlə təkrarlanmadığını qeyd edir.

LLM ilə qiymətlənmiş müqayisə

Erkən istifadə müsbətdir: Fast mode-u 374 istifadəçi sınadı, 29,1% onu iki və ya daha çox gün istifadə edir, ortaqla 3,67 hesab thread yaradır. 23% Fast mode-da qalmağı üstün tutub, 18% rejimlər arasında keçir və thread-lərin 40% Fast mode-da keçirilib. Müsbət rəy hər iki rejimdə oxşardır: Fast mode üçün 84,2% və Thinking mode üçün 85,2%.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.