Голос нейросети: кому он уже помогает и чем опасен
Синтез речи незаметно перешел из разряда лабораторных диковинок в обычный инструмент. Голосом нейросети читают аудиокниги, озвучивают обучающие курсы и объявления на вокзалах. Одновременно тот же инструмент попал в руки мошенников. Разбираемся, что изменилось технически, кому это принесло пользу и какие правила обращения с чужим голосом уже нельзя игнорировать.
Что поменялось за два года
Раньше машинная речь собиралась из заранее записанных фрагментов. Такую озвучку узнавали с первого слова: рубленые паузы, одинаковая интонация, неверные ударения в именах и географических названиях.
Модели нового поколения порождают речь целиком и опираются на смысл фразы, а не на склейку. В результате появляется интонация: вопрос звучит вопросом, перечисление перечислением. Русский язык такие модели держат наравне с английским, и это для нас ключевое отличие от ситуации пятилетней давности, когда все приличное было только на английском.
Кому это дало реальную пользу
Первыми выиграли люди с нарушениями зрения. Экранные читалки существовали всегда, но слушать их часами было тяжело именно из-за монотонности. Нормальная интонация превращает чтение с экрана из повинности в обычное слушание.
Вторая группа - все, кто учится. Конспект, статья, глава учебника превращаются в аудио и слушаются в дороге. Для студентов и для тех, кто получает вторую профессию после работы, это буквально возвращенные часы.
Третья - небольшие организации, у которых нет бюджета на диктора. Обучающий ролик для персонала, аудиоинструкция для посетителей, короткое видео о предприятии. Там, где раньше запись откладывали на неопределенный срок, теперь материал делается за вечер.
Четвертая - региональные медиа и авторы каналов. Текстовая заметка превращается в аудиоверсию, и ее слушают за рулем и на кухне те, кто читать с экрана не станет.
Как это выглядит для обычного пользователя
Никаких студий и оборудования. Текст вставляется в поле, голос выбирается из готового списка, подача настраивается несколькими ползунками, на выходе получается звуковой файл.
Единственное, что требует привычки, - подготовка текста. Машина читает ровно написанное, поэтому сокращения вроде «т.п.» и числа цифрами лучше заранее переписать словами, а длинные предложения разбить на короткие. Пять минут правки дают результат, который не приходится переслушивать с недоумением.
Работающий вариант - агрегаторы, где озвучка текста нейросетью идет в браузере с оплатой российской картой, а готовый файл скачивается обычным способом.
Обратная сторона: поддельный голос
Та же технология лежит в основе мошеннической схемы, о которой уже предупреждают банки. Человеку звонят голосом, похожим на голос сына, дочери или начальника, и просят срочно перевести деньги. Для убедительного подражания достаточно короткой записи, а взять ее можно из голосового сообщения или видео в открытом доступе.
Простое правило, которое стоит проговорить с пожилыми родственниками: голос больше не является доказательством личности. Ни при каких обстоятельствах. Договоритесь в семье о контрольном вопросе, ответ на который знают только свои, и перезванивайте на известный номер, а не на тот, с которого поступил звонок.
Второй сигнал тревоги неизменен со времен обычных телефонных обманов: срочность плюс деньги плюс просьба никому не рассказывать. Если совпали три признака, разговор нужно прекращать независимо от того, чей голос в трубке.
Что можно и чего нельзя
Законный сценарий: закадровый голос, который никого не изображает. Озвучка своего материала, аудиоверсия статьи, инструкция, дубляж собственного ролика.
Незаконный или как минимум спорный: озвучка от лица конкретного живого человека без его согласия. Это касается и публичных персон, и знакомых. Даже в формате шутки такой ролик уходит в пересылку, теряет контекст и дальше живет как настоящая запись.
Отдельно стоит помнить про пометки. Если синтез используется в материале, который люди могут принять за подлинную запись, честнее сказать об этом прямо в кадре или в описании. Практика маркировки складывается прямо сейчас, и издания, которые начали делать это сами, в итоге выигрывают в доверии.
Куда движется технология
Ближайшие изменения будут не в качестве звука, оно уже достаточное, а в управлении подачей. Разработчики учат модели держать единый характер голоса на длинной дистанции, чтобы часовая аудиокнига не распадалась на фрагменты с разным настроением.
Для слушателя это означает, что граница между записанным человеком и синтезом продолжит стираться. А значит, привычка проверять источник звука, а не доверять самому звуку, из совета для осторожных превращается в обычную бытовую гигиену.


