Назад
GPT-6 Astra, циклічні трансформери та суперечка про приховані міркування
SiTech AI Team3 წთ. საკითხავი

GPT-6 Astra, циклічні трансформери та суперечка про приховані міркування

Нова GPT-6 Astra від OpenAI очолює бенчмарки та демо роботи з компʼютером, а повідомлення про «циклічні трансформери» викликали суперечку про те, чи приховує модель свої міркування.

На початку вересня OpenAI випустила GPT-6 Astra, і дослідник машинного навчання Себастьян Рашка, який протестував модель протягом кількох днів, називає її найсильнішою з тих, якими він користувався.

У його огляді Astra переважає попередника GPT-5.6 майже всюди — у письмі, математиці, програмуванні, — але найбільший розрив у графічних демо та 3D-рендерингу. На тесті ARC-AGI-3, що поєднує логічні задачі та узагальнення, модель набирає 99,9 відсотка проти 7,8 відсотка у GPT-5.6 Sol.

Лідерство на фронтирі з застереженнями

На незалежних індексах Artificial Analysis картина стриманіша: Astra на фронтирі Coding Agent Index v1.4 та Intelligence Index v4.2, але без великого відриву. Оскільки ці оцінки змішують різні оболонки — Stirrup для GDPval-AA і AA-Briefcase, Terminus 2 для Terminal-Bench v2.1, — модель, налаштовану під одну основну оболонку, можуть недооцінювати.

Робота з компʼютером як новий фронт

Найпомітніший поступ — у роботі з компʼютером: модель керує програмами на локальній машині через застосунки ChatGPT і Codex. Серед демо, що ширилися мережею, — рендер Нью-Йорка в Blender і малювання мишею в браузерній версії MS Paint. Повідомляють, що OpenAI придбала десятки тисяч Mac Mini та Mac Studio, аби під час reinforcement learning модель бачила середовище macOS: скриншоти надходять, дії миші та клавіатури виходять, оболонка їх виконує й повертає нові знімки. Саме тренування відбувається інде — очільник Nvidia сказав, що Astra тренували приблизно на 100 тисячах GPU Grace Blackwell. Astra залишається моделлю міркування з навчанням на верифікованих винагородах.

Циклічні трансформери й приховані міркування

За два дні до запуску видання The Information повідомило, що Astra використовує «рекурентну глибину», або циклічний трансформер. У таких конструкціях ті самі блоки проходять кілька разів зі спільними вагами: Nanbeige4.2-3B проганяє 22 блоки двічі, Ouro від ByteDance повторює 48 блоків чотири рази, а Mixture-of-Recursions спрямовує кожен токен на одну-три ітерації. Прийом підвищує ефективну глибину, зберігаючи менше ваг, але обчислення й KV-кеш залишаються близькими до звичайної моделі тієї ж глибини; за оцінкою SMELT, для того самого значення втрат потрібно на 6,8–18 відсотка менше обчислень.

Рашка сумнівається, що циклічність приховує міркування. OpenAI з часів o1 не показує більшість слідів міркування, а Astra за однакової точності витрачає менше токенів, ніж GPT-5.6 Sol — це саме та закономірність, яку бачили між меншими моделями (Luna витрачає на 80 відсотків більше токенів за подібних результатів) без тривоги щодо інтерпретованості. Системна карта Astra справді фіксує зниження спостережуваності щодо Sol, переважно через коротші сліди. Головний науковець OpenAI Якуб Пачоцький заявив, що обчислювальний граф фронтирних моделей лежить у межах двократного перевищення GPT-4, і застеріг від «гонки до неспостережуваності, запущеної плутаною журналістикою».

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.