Top.Mail.Ru
\

Голос нейросети: кому он уже помогает и чем опасен

Синтез речи незаметно перешел из разряда лабораторных диковинок в обычный инструмент. Голосом нейросети читают аудиокниги, озвучивают обучающие курсы и объявления на вокзалах. Одновременно тот же инструмент попал в руки мошенников. Разбираемся, что изменилось технически, кому это принесло пользу и какие правила обращения с чужим голосом уже нельзя игнорировать.

Что поменялось за два года

Раньше машинная речь собиралась из заранее записанных фрагментов. Такую озвучку узнавали с первого слова: рубленые паузы, одинаковая интонация, неверные ударения в именах и географических названиях.

Модели нового поколения порождают речь целиком и опираются на смысл фразы, а не на склейку. В результате появляется интонация: вопрос звучит вопросом, перечисление перечислением. Русский язык такие модели держат наравне с английским, и это для нас ключевое отличие от ситуации пятилетней давности, когда все приличное было только на английском.

Кому это дало реальную пользу

Первыми выиграли люди с нарушениями зрения. Экранные читалки существовали всегда, но слушать их часами было тяжело именно из-за монотонности. Нормальная интонация превращает чтение с экрана из повинности в обычное слушание.

Вторая группа - все, кто учится. Конспект, статья, глава учебника превращаются в аудио и слушаются в дороге. Для студентов и для тех, кто получает вторую профессию после работы, это буквально возвращенные часы.

Третья - небольшие организации, у которых нет бюджета на диктора. Обучающий ролик для персонала, аудиоинструкция для посетителей, короткое видео о предприятии. Там, где раньше запись откладывали на неопределенный срок, теперь материал делается за вечер.

Четвертая - региональные медиа и авторы каналов. Текстовая заметка превращается в аудиоверсию, и ее слушают за рулем и на кухне те, кто читать с экрана не станет.

Как это выглядит для обычного пользователя

Никаких студий и оборудования. Текст вставляется в поле, голос выбирается из готового списка, подача настраивается несколькими ползунками, на выходе получается звуковой файл.

Единственное, что требует привычки, - подготовка текста. Машина читает ровно написанное, поэтому сокращения вроде «т.п.» и числа цифрами лучше заранее переписать словами, а длинные предложения разбить на короткие. Пять минут правки дают результат, который не приходится переслушивать с недоумением.

Работающий вариант - агрегаторы, где озвучка текста нейросетью идет в браузере с оплатой российской картой, а готовый файл скачивается обычным способом.

Обратная сторона: поддельный голос

Та же технология лежит в основе мошеннической схемы, о которой уже предупреждают банки. Человеку звонят голосом, похожим на голос сына, дочери или начальника, и просят срочно перевести деньги. Для убедительного подражания достаточно короткой записи, а взять ее можно из голосового сообщения или видео в открытом доступе.

Простое правило, которое стоит проговорить с пожилыми родственниками: голос больше не является доказательством личности. Ни при каких обстоятельствах. Договоритесь в семье о контрольном вопросе, ответ на который знают только свои, и перезванивайте на известный номер, а не на тот, с которого поступил звонок.

Второй сигнал тревоги неизменен со времен обычных телефонных обманов: срочность плюс деньги плюс просьба никому не рассказывать. Если совпали три признака, разговор нужно прекращать независимо от того, чей голос в трубке.

Что можно и чего нельзя

Законный сценарий: закадровый голос, который никого не изображает. Озвучка своего материала, аудиоверсия статьи, инструкция, дубляж собственного ролика.

Незаконный или как минимум спорный: озвучка от лица конкретного живого человека без его согласия. Это касается и публичных персон, и знакомых. Даже в формате шутки такой ролик уходит в пересылку, теряет контекст и дальше живет как настоящая запись.

Отдельно стоит помнить про пометки. Если синтез используется в материале, который люди могут принять за подлинную запись, честнее сказать об этом прямо в кадре или в описании. Практика маркировки складывается прямо сейчас, и издания, которые начали делать это сами, в итоге выигрывают в доверии.

Куда движется технология

Ближайшие изменения будут не в качестве звука, оно уже достаточное, а в управлении подачей. Разработчики учат модели держать единый характер голоса на длинной дистанции, чтобы часовая аудиокнига не распадалась на фрагменты с разным настроением.

Для слушателя это означает, что граница между записанным человеком и синтезом продолжит стираться. А значит, привычка проверять источник звука, а не доверять самому звуку, из совета для осторожных превращается в обычную бытовую гигиену.

\n\n\n\n\n\n
\n\n