Архитектуры моделей
Модели аудио, речи и музыки
Семейство специализированных конвейеров: распознавание речи, синтез речи, понимание аудио, преобразование голоса, генерация звука и генерация музыки – это не одна архитектура.
Ментальная модель
Сначала выберите задачу. ASR преобразует аудио в текст; TTS и генерация музыки преобразуют условия в акустические или кодековые представления; понимание преобразует аудио в метки или эмбеддинги.
Поток данных
- Волнограмма или спектрограмма
- Акустическое / кодековое представление
- Кодировщик, seq2seq, диффузия или генератор токенов
- Текст, метки, кодовые токены или волнограмма
- Задача-специфическая декодировка
Как проходит обучение
Цели варьируются: транскрипция использует вероятность последовательности, обучение представлений может маскировать аудио, генераторы кодеков предсказывают дискретные аудиотокены, а диффузионные системы обучаются шумоподавлению в волнограмме, спектрограмме или латентном пространстве.
Как выполняется инференс
ASR обычно кодирует аудио, затем декодирует текст; генерация может предсказывать кодовые токены авторегрессивно или итеративно устранять шум. Ограничения потоковой передачи могут требовать фрагментированных кодировщиков и ограниченного предпросмотра.
Сильные стороны
- Распознавание и перевод речи
- Естественный синтез речи, звука и музыки
- Аудио-эмбеддинги поддерживают поиск, модерацию и классификацию
Компромиссы
- Акценты, шум, перекрытие, языковой сдвиг кода и словарный запас домена ухудшают качество
- Генерация длинной формы требует временной структуры и согласованности
- Идентичность голоса, согласие, водяные знаки и авторские права требуют явного управления
Использовать, когда
- Собственно модальность несет необходимую информацию
- У вас есть оценки, специфичные для задачи, языка и среды
- Требования к задержке и потоковой передаче определены заранее
Избегать или пересмотреть, когда
- Транскрипт уже содержит всю релевантную информацию
- Клонирование личности лишено информированного согласия
- Один бенчмарк используется в качестве доказательства для разных языков и акустических условий
Примеры опубликованных семейств
- • ASR кодировщик-декодер типа Whisper
- • Генерация кодовых токенов иерархического типа AudioLM
- • Системы диффузии волнограммы или латентного пространства