Geri qayıt
GPT-6 Astra, dövrəli transformerlər və gizli düşüncə mübahisəsi
SiTech AI Team2 წთ. საკითხავი

GPT-6 Astra, dövrəli transformerlər və gizli düşüncə mübahisəsi

OpenAI-ın yeni GPT-6 Astra-sı testlərdə və kompüter istifadəsi demolarlında öndədir, "dövrəli transformer" xəbərləri isə düşüncənin gizlədilməsi ilə bağlı mübahisə yaradıb.

OpenAI sentyabrın əvvəlində GPT-6 Astra-nı buraxdı. Modeli bir neçə gün ərzində sınaqdan keçirən maşın öyrənməsi tədqiqatçısı Sebastyan Raşka onu indiyədək istifadə etdiyi ən güclü model adlandırır.

Onun icmalına görə Astra, sələfi GPT-5.6-nı demək olar hər sahədə üstələyir: yazı, riyaziyyat, kodlaşdırma. Ən böyük fərq isə qrafik demolar və 3D render işlərindədir. Məntiq tapmacalarını ümumiləşdirmə ilə birləşdirən ARC-AGI-3 testində model 99,9 faizə çatır, GPT-5.6 Sol isə 7,8 faizdə qalır.

Ehtiyatlı sərhəd liderliyi

Müstəqil Artificial Analysis indekslərində mənzərə daha təmkinlidir: Astra Coding Agent Index v1.4 və Intelligence Index v4.2-də sərhəddədir, lakin böyük fərqlə qabağa çıxmır. Bu qiymətləndirmələr fərqli mühitləri qarışdırdığı üçün — GDPval-AA və AA-Briefcase üçün Stirrup, Terminal-Bench v2.1 üçün Terminus 2 — bir əsas mühitə uyğunlaşdırılmış model aşağı qiymətləndirilə bilər.

Yeni cəbhə: kompüter istifadəsi

Ən təsirli irəliləyiş kompüter istifadəsindədir: model ChatGPT və Codex tətbiqləri vasitəsilə yerli maşındakı proqramları idarə edir. Yayılan demolarda Nyu-Yorkun Blender-də render edilməsi və brauzerdəki MS Paint-də siçanla rəsm çəkmək var. Bildirilir ki, OpenAI gücləndirilmiş öyrənmə zamanı modelə macOS mühitini tanıtmaq üçün on minlərlə Mac Mini və Mac Studio alıb: ekran görüntüləri daxil olur, siçan və klaviatura hərəkətləri çıxır, mühit onları icra edib yeni görüntüləri geri göndərir. Təlimin özü başqa yerdə gedir — Nvidia rəhbərinin sözlərinə görə, Astra təxminən 100 min Grace Blackwell GPU-da öyrədilib. Astra yoxlanıla bilən mükafatlarla təlim keçən düşüncə modeli olaraq qalır.

Dövrəli transformerlər və gizli düşüncə

Buraxılışdan iki gün əvvəl The Information yazdı ki, Astra "təkrarlanan dərinlik", yəni dövrəli transformer istifadə edir. Belə quruluşlarda eyni bloklar ortaq çəkilərlə bir neçə dəfə tətbiq olunur: Nanbeige4.2-3B 22 bloku iki dəfə işlədir, ByteDance-in Ouro-su 48 bloku dörd dəfə təkrarlayır, Mixture-of-Recursions isə hər tokeni bir-üç keçidə yönləndirir. Bu üsul effektiv dərinliyi artırır, daha az çəki saxlayır, lakin hesablama və KV keş xərci eyni dərinlikdəki adi modelə yaxın qalır; SMELT-in qiymətləndirməsinə görə eyni itki üçün 6,8–18 faiz az təlim hesablaması tələb olunur.

Raşka dövrənin düşüncəni gizlətdiyinə şübhə edir. OpenAI o1-dən bəri düşüncə izlərinin çoxunu göstərmir və Astra bərabər dəqiqlikdə GPT-5.6 Sol-dan az token sərf edir — bu, kiçik modellər arasında da görülən bir qanunauyğunluqdur (Luna oxşar nəticələr üçün Sol-dan 80 faiz çox token sərf edir) və izahlılıq narahatlığı yaratmayıb. Astra-nın sistem kartı Sol-la müqayisədə izlənmə qabiliyyətinin azaldığını, bunun əsasən daha qısa izlərdən qaynaqlandığını qeyd edir. OpenAI-ın baş elmi işçisi Yakub Paçotski sərhəd modellərinin hesablama qrafikinin GPT-4-ün ikiqat həddi daxilində olduğunu bildirdi və "çaşqın reportajla başladılan izlənməzlik yarışına" qarşı xəbərdarlıq etdi.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.