Лекция: Распознавание речи

Обучить компьютер понимать человеческую речь и «озвучивать» различные синтезируемые «на лету» сообщения — до сих пор остается чрезвычайно заманчивой задачей. Решить ее означало бы существенно продвинуться на пути к реализации естественного интерфейса пользователя.

Чисто формально процесс распознавания речи можно описать буквально в нескольких фразах. Аналоговый сигнал, генерируемый микрофоном, оцифровывыается, и далее в речи выделяются так называемые фонемы, то есть элементарные фрагменты, из которых состоят все произносимые слова. Затем определяется, какое слово, какому сочетанию фонем соответствует, и строится соответствующий словарь. Распознать слово — значит найти его в этом словаре по произнесенному сочетанию фонем.

Во-первых, человек обычно не делает паузы между словами, а при слитном произнесении к задаче распознавания прибавляется еще и задача выделения слов из потока речи, что заведомо более сложно. Особенно «неприятной» кажется необходимость выделять односложные слова — именно с ними и связано максимальное число ошибок реально существующих систем. Следующая проблема — различие голосов, диалектов, дикций и прочие индивидуальные особенности говорящих.

Существует два существенно различающихся режима работы: с настройкой на голос определенного человека и без такой настройки. Размеры словаря при работе с настройкой на голос могут достигать нескольких тысяч слов при слитном произнесении.

Наиболее сложный для реализации, но одновременно и наиболее перспективный режим работы — распознавание без настройки на голос. При этом гарантируется, что система распознает любое включенное в словарь слово, кем бы оно ни было произнесено. Здесь, как правило, словари насчитывают небольшое количество слов и существуют для небольшого числа языков.

Создание словаря для распознавания речи без настройки на голос — дело весьма сложное и дорогое.

еще рефераты
Еще работы по информатике