Назад
Чип Jalapeño від OpenAI випереджає Nvidia Blackwell в інференсі
SiTech AI Team2 წთ. საკითხავი

Чип Jalapeño від OpenAI випереджає Nvidia Blackwell в інференсі

Тести SemiAnalysis показують, що власний інференс-чип OpenAI Jalapeño переважає Nvidia Blackwell за продуктивністю на ват — завдяки одному токену й без спекулятивного декодування.

OpenAI створила власний інференс-чип, і перші бенчмарки свідчать, що він може конкурувати з апаратурою Nvidia, AMD і Google. Результати, опубліковані 25 серпня, отримані SemiAnalysis під час запуску набору InferenceX у лабораторіях OpenAI разом з інженерами компанії.

Що таке Jalapeño

Чип під кодовою назвою Jalapeño представили на конференції Hot Chips, його розробляють у партнерстві з Broadcom. Робота над дизайном почалася в середині 2024 року, і від першого найму до виробничого tape-out минуло близько 16 місяців; CoWoS tape-out завершили в листопаді 2025 року. Опубліковані результати отримано на степу A0 приблизно на дев'ятому місяці програми; степ B0 уже у фабриці й має покращити продуктивність на ват приблизно на 25 відсотків.

Продуктивність на ват

Ключовий показник — пропускна здатність токенів на один мегават із урахуванням усіх витрат. За ним Jalapeño переважає Blackwell майже в усіх протестованих сценаріях, причому лише з передбаченням одного токена — без спекулятивного декодування та без розділення prefill і decode — тоді як порівнювані системи працювали в найкращих конфігураціях із багатотокенним передбаченням. За низького навантаження чип перевищив 700 токенів за секунду на користувача на DeepSeek R1; на Kimi K2.5 він наблизився до 700 токенів/с/користувача і був понад у дев'ять разів швидшим за наступний найкращий чип на рівні 100 токенів/с/користувача. Оцінювання GSM8k виявилося на рівні чипів Nvidia.

Узагальнений чип і домен на 2048 прискорювачів

Попри уявлення, що такі чипи налаштовані лише під моделі власника, SemiAnalysis описує Jalapeño як узагальнений інференс-прискорювач: він запускав кілька відкритих моделей і набір InferenceX, а OpenAI навіть показала Doom на цьому чипі — гру портували за допомогою підказок Codex. Чип використовує обчислювальний кристал розміром з ретикль на процесі TSMC N3P, I/O-чиплет на N3E, з'єднання PCIe Gen 5 з x86-хостом і пам'ять HBM4 з пропускною здатністю близько 15,4 ТБ/с на пакет. У стійці 128 чипів, з'єднаних комутаторами Tomahawk 6 на 102,4 Тб/с, а 16 таких стійок — 2048 прискорювачів — утворюють один домен масштабування.

Застереження і подальші кроки

Видання наводить і обмеження: усі цифри надала OpenAI, перевірені на місці запуски охоплювали навантаження 8k1k, а результатів AgentX ще немає. Автори також вважають, що порівнювати Jalapeño з Blackwell не зовсім коректно, адже Jalapeño використовує HBM4 — те саме покоління, що й Rubin. За вартістю токена Jalapeño і Vera Rubin приблизно рівні, але показники Jalapeño отримані без спекулятивного декодування, яке зазвичай знижує вартість токена в кілька разів. Виробництво нарощуватимуть протягом 2027 року, більшість обсягу очікується наприкінці наступного року, а наступна мета — розгортання на 100 МВт.

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.