Речь: ASR и TTS

Speech (ASR / TTS)

Признаки звука, акустические модели, декодирование и синтез

Спрашивают: Яндекс, Сбер, МТС. Закрывает проверки: Секция по речи (1).

Направление распознавания и синтеза речи: как звук превращается в признаки, какие модели переводят их в текст, чем измеряют качество и как устроен обратный путь — из текста в звук.

15вопросов в заходе
24всего в банке
4оси знаний
~11минут на прохождение
Что спрашивать
Уровень
Признаки звукаАкустические моделиЯзыковая модель и декодированиеСинтез речи
  1. Отвечаете на вопрос — сразу видите разбор, а не только «верно/неверно».
  2. В конце получаете результат по осям и список тем, которые стоит перечитать.
  3. Темы с ошибками ставятся на повторение — кабинет напомнит о них через 3, 7 и 21 день.

Открытые задачи

2 задачи без вариантов ответа — такие дают на собеседовании уровня middle и senior. Ответ проверяется по чек-листу: он остаётся в браузере и не идёт в результат теста.

ASR показывает WER 6 % на чтении и 28 % на телефонных звонках. Как сокращать разрыв?

Акустические моделиSenior

Сначала ответьте — иначе проверка превращается в чтение.

Как построить оценку качества распознавания, чтобы она отражала пользу для продукта, а не только WER?

Языковая модель и декодированиеMiddle

Сначала ответьте — иначе проверка превращается в чтение.