Amazon Web Services stellt einen neuen Deep-Learning-Container für WhisperX bereit. Wie AWS mitteilt, bündelt das Paket Whisper, wav2vec2 für Forced Alignment sowie Sprecherdiarisierung in einem für Grafikprozessoren vorbereiteten Abbild („The AWS WhisperX Deep Learning Container packages Whisper, wav2vec2 forced alignment, and speaker diarization into a GPU-ready image“). Nutzer können diesen Container auf Amazon SageMaker AI sowohl auf Echtzeit- als auch auf asynchronen Endpunkten bereitstellen, um Transkriptionen auf Wortebene mit Sprecherkennzeichnung zu erhalten („deploy it to Amazon SageMaker AI real-time and asynchronous endpoints for word-level, speaker-labeled transcription“).
Der Leitfaden thematisiert zudem relevante Aspekte für den produktiven Betrieb der Lösung. Dabei behandelt AWS spezifische Details wie das Fixieren des GPU-AMI, die Skalierung sowie Methoden zur Kostenkontrolle („plus the production details that matter: the GPU AMI pin, scaling, and cost controls“). Entwickler erhalten damit Hinweise zur technischen Umsetzung automatisierter Spracherkennung in bestehenden Cloud-Infrastrukturen.

