Geri qayıt
AWS, SageMaker AI üçün danışan etiketli WhisperX konteynerini təqdim etdi
SiTech AI Team2 წთ. საკითხავი

AWS, SageMaker AI üçün danışan etiketli WhisperX konteynerini təqdim etdi

AWS, WhisperX-in Amazon SageMaker AI üzərində işlədilməsi üçün təlimat yayımlayıb. Konteyner OpenAI-nin Whisper modelinə söz səviyyəsində vaxt işarələri və danışanların ayrılması əlavə edir.

AWS, OpenAI-nin Whisper modeli üzərində qurulmuş açıq mənbəli nitq tanıma layihəsi WhisperX-in Amazon SageMaker AI-da işlədilməsi üçün təlimat dərc edib. Yazıda AWS WhisperX Deep Learning Container və onun iki yerləşdirmə yolu təqdim olunur.

WhisperX Whisper-a nə əlavə edir

Whisper nitqi bir çox dildə dəqiq mətnə çevirir, lakin vaxt işarələrini ifadə səviyyəsində qaytarır və kimin danışdığını göstərmir. WhisperX üç şey əlavə edir: daha sürətli transkripsiya üçün qruplaşdırılmış emal, söz səviyyəsində vaxt işarələri üçün wav2vec2 məcburi düzlənməsi və danışanların ayrılması.

Konteyner Whisper-ı, düzlənmə modellərini və danışanların ayrılması çəkilərini bir GPU obrazında saxlayır, Hugging Face tokeni tələb olunmur. 8080 portunda işləyir, POST /invocations və GET /ping təqdim edir, audio faylı və language, diarize sahələrini multipart/form-data kimi qəbul edir, nəticəni json, verbose_json, srt və ya vtt formatında qaytarır.

Real vaxt, yoxsa asinxron endpoint

Real vaxt endpointi sinxrondur: audio sorğuda göndərilir və transkript həmin çağırışda qaytarılır, ona görə yazı SageMaker AI-ın 60 saniyəlik həddinə sığmalıdır. Endpoint işlək qaldığı müddətdə ödənişlidir.

Real vaxt endpoint sorğusunun axını

Asinxron endpoint audionu Amazon S3-ə yükləyir, InvokeEndpointAsync-i obyekt istinadı ilə çağırır və çıxış yolunu yoxlayır; uğursuz işlər üçün ayrıca failure yolu var. Cavab müddəti həddi olmadığı üçün AWS uzun yazılar və toplu işlər üçün bu yolu tövsiyə edir, boş qaldıqda isə sıfır instansa qədər kiçilə bilər.

Amazon S3 üzərindən asinxron axın

İstehsal detalları və Flight 1549 testi

Hər iki yol eyni şeyləri tələb edir: xərci azaltmaq üçün ml.g4dn.xlarge, ehtiyat üçün ml.g5.2xlarge və GPU AMI-nin al2-ami-sagemaker-inference-gpu-3-1 versiyasına bağlanması; bu olmadan CUDA 12.8 obrazı boş loqla CannotStartContainerError qaytarır. Bir konteyner bir sorğu emal edir, ona görə məhsuldarlıq instans əlavə etməklə artır, asinxron rejimdə isə S3 bucket-inin adında sagemaker sözü olmalıdır.

Nümunə notebook US Airways Flight 1549 reysinin hava hərəkəti söhbətlərinin açıq qeydini emal edir; radio küyü və sürətli çağırış işarələri onu çətin sınağa çevirir. Üç dəqiqəlik yazı asinxron, 40 saniyəlik hissə real vaxt endpointinə göndərilir. AWS həmçinin tez-tez yoxlama yerinə SNS bildirişlərini, beş instans tipinə qədər pool və şəxsi məlumatların söz vaxt işarələri ilə silinməsini tövsiyə edir. GPU endpointləri silinənə qədər ödənişlidir.

SSiTech

SiTech — AI ilə gücləndirilmiş veb hazırlanması

Sürətli və müasir saytlar qurur, AI-ı real biznes proseslərinə gətiririk. Layihəniz və ya sualınız var? Kömək etməyə hazırıq.