ASR показывает WER 6 % на чтении и 28 % на телефонных звонках. Как сокращать разрыв?
Сначала ответьте — иначе проверка превращается в чтение.
Speech (ASR / TTS)
Признаки звука, акустические модели, декодирование и синтез
Спрашивают: Яндекс, Сбер, МТС. Закрывает проверки: Секция по речи (1).
Направление распознавания и синтеза речи: как звук превращается в признаки, какие модели переводят их в текст, чем измеряют качество и как устроен обратный путь — из текста в звук.
2 задачи без вариантов ответа — такие дают на собеседовании уровня middle и senior. Ответ проверяется по чек-листу: он остаётся в браузере и не идёт в результат теста.