
AWS випустила контейнер WhisperX для SageMaker AI з розміткою мовців
AWS опублікувала посібник із запуску WhisperX на Amazon SageMaker AI: контейнер додає до моделі Whisper від OpenAI позначки часу для кожного слова та розділення мовців.
AWS опублікувала посібник із запуску WhisperX, відкритого проєкту розпізнавання мовлення на базі Whisper від OpenAI, на Amazon SageMaker AI. У публікації описано контейнер AWS WhisperX Deep Learning Container і два способи його запуску: через синхронну або асинхронну кінцеву точку.
Що додає WhisperX до Whisper
Whisper точно транскрибує мовлення багатьма мовами, але повертає позначки часу на рівні фрази і не вказує, хто говорить. WhisperX додає три речі: пакетне виконання для швидшої транскрипції, вирівнювання wav2vec2 для позначок часу кожного слова та діаризацію мовців.
Контейнер містить Whisper, моделі вирівнювання й ваги діаризації в одному GPU-образі, тому токен Hugging Face не потрібен. Він працює на порту 8080, надає POST /invocations і GET /ping, приймає multipart/form-data з аудіофайлом і полями language та diarize, а результат віддає у форматах json, verbose_json, srt або vtt.
Синхронна чи асинхронна кінцева точка
Синхронна кінцева точка працює в межах одного виклику: аудіо передається в запиті, а транскрипт повертається у відповіді, тож запис має вкластися в 60-секундний ліміт SageMaker AI. Вона тарифікується, поки працює.
Асинхронна кінцева точка завантажує аудіо в Amazon S3, викликає InvokeEndpointAsync за посиланням на об'єкт і опитує шлях виводу, а для невдалих завдань передбачено окремий шлях помилок. Обмеження часу відповіді немає, тому AWS радить цей варіант для довгих записів і пакетної обробки; у простої вона може масштабуватися до нуля інстансів.
Деталі для продакшену та тест на Flight 1549
Обидва варіанти потребують того самого: ml.g4dn.xlarge для економії або ml.g5.2xlarge для запасу потужності, а також прив'язки GPU AMI al2-ami-sagemaker-inference-gpu-3-1, без якої образ CUDA 12.8 не запускається і повертає CannotStartContainerError з порожнім логом. На один контейнер припадає один запит, тож пропускну здатність нарощують інстансами, а в назві бакета S3 для асинхронного режиму має бути слово sagemaker.
Демонстраційний notebook обробляє запис радіообміну рейсу US Airways Flight 1549 з відкритого джерела, з шумом ефіру та швидкими позивними: три хвилини для асинхронного режиму і 40 секунд для синхронного. AWS також радить повідомлення SNS замість частого опитування, пул до п'яти типів інстансів і редагування персональних даних за позначками часу слів. GPU-інстанси тарифікуються, доки їх не видалити.
SiTech — веброзробка з підтримкою AI
Створюємо швидкі та сучасні сайти й інтегруємо AI у бізнес-процеси. Маєте проєкт чи запитання? Із задоволенням допоможемо.