Текст вслух, без студии в браузере
Обычный путь к синтезу речи выглядит так: найти сервис, зарегистрироваться, попасть в веб-студию с дорожками и ползунками, разобраться в интерфейсе, сгенерировать, скачать файл, переслать его туда, где он нужен.
Здесь короче: отправить текст в переписку — получить аудиофайл в ответ. Файл сразу лежит там, где им пользуются, и пересылается одним касанием.
Что именно приходит
Аудиофайл в формате WAV. Это важное уточнение, и лучше знать его заранее: это не то круглое голосовое сообщение, которое Telegram рисует волной и проигрывает встроенным плеером. Это обычный файл — его можно переслать, скачать, положить в монтаж или в презентацию. Родного формата голосовых сообщений здесь нет.
Язык определяется по тексту. Русский текст звучит по-русски, английский — по-английски, и переключать ничего не нужно: языкового параметра в запросе к модели нет вообще, она определяет язык по тексту. Сколько именно языков она узнаёт — её свойство, а не наша настройка, и мы это число не называем.
Голос и манера выбираются один раз. Команда /voices открывает выбор из четырёх голосов и трёх манер речи. Выбор запоминается и применяется ко всем следующим озвучкам, пока вы его не смените.
Что честно сказать о качестве
Синтез работает на предварительной версии модели. Это не оговорка ради оговорки: означает, что качество хорошее, но обещать неотличимость от живой записи было бы неправдой, и мы этого не обещаем.
Русская речь у синтеза традиционно уязвима в одном месте — ударения. Омографы («за́мок» и «замо́к», «бо́льшая» и больша́я») и незнакомые имена собственные озвучиваются по вероятности, а не по смыслу фразы. Если текст пойдёт в публикацию, прослушайте его целиком и при промахе переформулируйте: заменить слово надёжнее, чем надеяться, что во второй раз повезёт.
Аббревиатуры, номера и даты тоже стоит проверить: их читают то по буквам, то как слово, и предсказать это по тексту нельзя.
Клонирования голоса здесь нет
Сознательно. Загрузить образец чужой или своей речи и получить её копию нельзя — такой функции не существует, а не «пока не сделали».
Доступны четыре предустановленных голоса. Этого достаточно для озвучки текста, заметок вслух и черновой дорожки, и недостаточно для того, чтобы говорить чужим голосом.
Ограничения и цена
1000 символов на одну озвучку. Текст длиннее отклоняется честно, с прямым отказом, — он никогда не обрезается молча. Молчаливое обрезание в озвучке хуже отказа: вы узнаёте о нём, только дослушав файл до конца.
Три озвучки в сутки — бесплатно. Дальше $0.10 за штуку. Цена названа заранее, а списание происходит в момент отправки текста: отдельного шага подтверждения нет. Если синтез или доставка сорвутся, деньги возвращаются.
Одна честность про бесплатный тариф: дневной слот занимается в момент запуска, ещё до обращения к синтезу. То есть неудачная бесплатная попытка израсходует одну из трёх. Это неприятно, зато сказано прямо, а не обнаружено вами на третьей попытке.
Когда этим удобно пользоваться
- Длинный текст, который проще прослушать. Статья, заметка, конспект — по дороге, за рулём, во время дел.
- Черновая озвучка. Дорожка для ролика или презентации, чтобы услышать хронометраж и ритм до записи живого голоса.
- Проверка текста на слух. Написанное читается иначе, чем звучит: неудобные обороты и слишком длинные предложения слышны сразу.
- Отправить голосом, когда неудобно записывать. Файл пересылается, как любой другой.
Когда лучше выбрать другое
Если нужен именно формат голосового сообщения с волной и встроенным проигрывателем — здесь его нет.
Если нужен собственный голос, эмоциональная игра или профессиональная озвучка — это студийная задача, и предварительная версия модели её не закрывает.
Если текст длиннее тысячи символов и делить его не хочется — это тоже не сюда.