Назад
Ai2 замінює планувальник GPU на основі пріоритетів системою бюджетів і справедливого розподілу
SiTech AI Team3 хв читання

Ai2 замінює планувальник GPU на основі пріоритетів системою бюджетів і справедливого розподілу

Allen Institute for AI (Ai2) замінив планувальник кластера на основі пріоритетів бюджетами часу GPU, ієрархічним справедливим розподілом і контрактом поділу часу; очікування на налагодження скоротилося з годин до секунд.

Штучний інтелект Allen Institute (Ai2) замінив на GPU-кластерах планувальник на основі пріоритетів системою, заснованою на бюджетах часу GPU, ієрархічному справедливому розподілі та контракті поділу часу. З кінця липня поетапно впроваджувана зміна надає пріоритет дослідженням з великим впливом і підтримує повне завантаження тисяч Nvidia H100, B200 і B300 GPU.

Від пріоритетів до бюджетів

Ai2 керує кластерами від 88 до 1024 GPU для приблизно 150 внутрішніх дослідників, які розвивають великі мовні та зорові моделі, навчання з підкріпленням для робототехніки та подальші дослідження наукових агентних застосунків. Попит на час GPU у два-три рази перевищує постачання.

Старий планувальник спирався на пріоритети та необов’язкову премпцію. Користувачі займали місце для налагодження марним навантаженням, заплановані навантаження були на 100 відсотків з пріоритетом HIGH, а інші інженери витрачали час на ручне призупинення непремптованих завдань на потрібних хостах обслуговування.

Нова модель розглядає час GPU як інвестицію. Менеджери розподіляють бюджети між проєктами та дослідниками до появи навантажень, перетворюючи стратегію на гарантовану частку потужності. Кожен запит має бути профінансований бюджетом, інакше він не буде захищений від премпції, що робить зайняття місця дорогим.

Планування справедливого розподілу та контракт поділу часу

Ієрархічний планувальник справедливого розподілу, коріння якого лежить у Hadoop Fair Scheduler 2009 року і який сьогодні використовується в SLURM та YARN, відстежує завантаження у рухомому семиденному вікні та розміщує менш використані виділення навантажень вище більш використаних. Дерево повторює структуру дослідницької програми, а вагами є бюджети менеджерів, а не статичні квоти.

Планувальник відрізняє виділене завантаження, яке враховується з бюджету і захищено у мінімальному робочому вікні, від виділення без оплати, яке є премптованим. Контракт вимагає оголошення мінімального робочого часу тривалістю максимум 8 годин, під час якого зупинення неможливе. Потім тривалі навантаження автоматично повертаються в чергу, щоб стабілізувати справедливий розподіл і звільнити несправні хости для автоматичного відновлення.

Результати та відкриті виклики

У 30-денному тесті команди отримали 98 відсотків призначених GPU-годин; з 15 виділень команд 13 отримали 95 відсотків або більше, найгірший випадок становив 90 відсотків. Завантаження кластера залишилося на рівні 98 відсотків, 18 відсотків наданого часу GPU залишилося невикористаним, щоб апаратура була завантажена, коли профінансовані навантаження ще не були готові.

Для налагоджувальних навантажень очікування в черзі p90 впало з 2 годин до 30 секунд, що краще симуляційного прогнозу від 6 годин до 5 хвилин. На найбільшому кластері H100 медіана зменшилася з 5 хвилин до 24 секунд, а p90 — з 2,8 години до 1,8 години. Ручних втручань, необхідних для відновлення, стало на 74 відсотки менше.

Не всі застосунки покращилися. Інтерактивні сеанси аналізу, які дослідники зберігали до одного тижня, після восьмигодинного захищеного ліміту стали премптованими, і користувачам доводиться вручну відновлювати мінливий стан. Ai2 тепер розвиває кластер тільки для сеансів розробки та планує відновлювальні сеанси, щоб перервана робота продовжувалася в іншому місці. Команда досліджує фрагментацію потужності, яка може збільшити очікування на великих навантаженнях, і заявляє, що наступний фокус — якість використання: максимально ефективне ведення bootstrapping, checkpointing і навчальних застосунків.

Джерела: Hugging Face Blog

SSiTech

SiTech — веброзробка з підтримкою AI

Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.