
Главная проблема голосовых ассистентов и роботов – монотонность. Их синтезированный голос лишен эмоциональной окраски, что затрудняет восприятие информации человеком. Без правильной мелодики фразы сложно понять: задает собеседник вопрос или утверждает факт. Именно эта коммуникативная глубина оставалась недоступной для алгоритмов до недавнего времени.
Ученые кафедры фонетики СПбГУ под руководством профессора Павла Скрелина и доцента Нины Вольской разработали уникальную классификацию интонационных конструкций. Они выделили ключевые акустические маркеры: тембр, темп речи, мелодический диапазон и силовое ударение. Эти параметры легли в основу обучающего датасета для нейросети Tacotron2. Алгоритм анализировал размеченные аудиофрагменты, где каждый звук был связан с конкретной эмоцией и синтаксической ролью.
Результат превзошел ожидания. Нейросеть освоила сложную иерархию смысловых отношений во фразе. Теперь она способна модулировать голос, превращая повествование в риторический вопрос или вежливую просьбу лишь за счет изменения тонального рисунка. Доцент Ульяна Кочеткова отмечает, что такая гибкость открывает дорогу к созданию по-настоящему эмпатичных интерфейсов.
Новая технология найдет применение не только в бытовых помощниках. Она позволит создать эффективных цифровых преподавателей, адаптирующихся к реакции ученика, а также усовершенствует реабилитационные программы для людей с нарушениями речи. Ранее эти же специалисты представили методику распознавания иронии по вокальным и мимическим признакам.
Результаты исследования опубликованы в материалах International Conference on Speech and Computer.













