Аудиокнига своими руками: как я озвучил 200 страниц нейросетью и не потратил ни рубля

Полтора часа я начитывал первую главу своей книги, потом включил запись — и услышал, как я мычу, шмыгаю носом и на середине абзаца ухожу за кофе. Такую озвучку даже бесплатно никто слушать не станет. Именно тогда я полез искать, как озвучить аудиокнигу бесплатно, и через неделю у меня на руках был готовый файл на семь часов. Рассказываю, что реально работает, а где я потерял два вечера.

Шаг 1. Текст придётся переписать под ухо

Первая ошибка — залить в генератор готовый docx и ждать чуда. Письменный текст и звучащий текст — это два разных текста.

  • Выкиньте всё, что отсылает к картинкам: «см. рисунок 3», «в таблице ниже», «как показано выше». На слух это мусор.
  • Длинные предложения с тремя придаточными разрезайте. Я резал по запятым, где только можно.
  • Цифры, аббревиатуры и латиницу лучше расписать словами. «2024» нейросеть прочитает как «две тысячи двадцать четыре», а «т.е.» может превратиться в «тэ-е».
  • Имена собственные проверьте отдельно. Название моего города синтезатор упорно читал с ударением на последний слог — пришлось писать его так, как слышится.

Лайфхак, который сэкономил мне кучу времени: прочитайте главу вслух сами. Спотыкаетесь вы — споткнётся и синтез речи бесплатно, только уже без права на исправление.

Шаг 2. Свой голос или готовый?

Тут развилка, и от неё зависит всё остальное.

Первый путь — клонировать свой голос. Звучит страшно, на деле загружаешь минутную запись, и система собирает модель, которая повторяет тембр и манеру. Клонирование голоса бесплатно уже не фантастика: я делал это через клонирование голоса онлайн, и для нон-фикшена результат оказался даже лучше, чем я ждал — слушатель слышит автора, а не робота. Пишете от первого лица? Тогда это единственный вариант, который не выглядит фальшиво.

Второй путь — взять готовый голос из библиотеки. Голосовой синтезатор онлайн даёт десятки вариантов, и вот здесь есть нюанс: не берите самый «эффектный» голос. Вам с ним слушать семь часов подряд. Ищите ровный, тёплый, без театральных взлётов — на длинной дистанции выигрывает скучный.

Шаг 3. Генерация: по главам, а не всё сразу

Соблазн закинуть весь текст одним куском велик. Не делайте так. Одна опечатка — и переделывать всё.

Я гнал по главе: вставил, поставил скорость чуть ниже средней (для аудиокниг это критично, на 1.0 слушатель устаёт), прослушал первые тридцать секунд, и только потом запускал остальное. Кстати, про регистрацию: мне нужен был синтез голоса без регистрации, потому что я тестировал пять разных тембров и не хотел плодить аккаунты. Нейроозвучка бесплатно в браузере это позволяет — открыл, вставил, скачал.

Отдельно про русский язык. Многие сервисы отлично звучат на английском и спотыкаются на «ё» и падежах. Мне нужен был text to speech на русском бесплатно, и я специально проверял на тексте с числительными и сложными фамилиями — там всё вылезает наружу сразу. И ещё: когда ищешь текст в речь бесплатно, легко нарваться на лимит в 500 символов на запрос. Это не приговор, просто придётся резать главу на куски и потом склеивать.

Шаг 4. Монтаж — вот где любитель отличается от профи

Сгенерированный файл чистый, но это ещё не аудиокнига.

  • Пауза между главами — 1,5–2 секунды. Не больше, иначе слушатель думает, что запись оборвалась.
  • Подрежьте щелчки в начале и конце каждого файла. В наушниках их слышно отлично.
  • Нормализуйте громкость. Если первая глава громче десятой, это раздражает сильнее, чем плохой голос.
  • Интро: название, автор, короткая музыка. Только берите трек без лицензионных хвостов.

Мне хватило Audacity. Экспорт — MP3, 192 кбит/с и выше.

Шаг 5. Куда это выкладывать

Вариантов три, и они не взаимоисключающие.

Свои каналы — Telegram, VK, рассылка. Здесь вы никому не отчитываетесь за синтетический голос. Магазины аудиокниг — у каждой площадки свои требования к битрейту и метаданным, читайте их до, а не после. Короткие фрагменты — отлично работают как промо: нарезали по минуте, выложили, послушали реакцию.

Кстати, тот же инструмент я потом приспособил как голос для видео нейросеть бесплатно — нарезка для соцсетей собирается за вечер, и закадровый текст уже не надо начитывать самому. Озвучка текста бесплатно закрывает сразу две задачи: книгу и короткие ролики.

И про юридическую сторону, раз уж мы в России. Я специально проверял: если текст ваш и голос ваш — проблем нет. Чужой голос без письменного разрешения — нет, никогда. Плюс держите в голове, что голосовые слепки и персональные данные сейчас под прицелом: если работаете с записями клиентов, лучше держать их на сервисах с хранением данных в РФ.

Частые вопросы

Можно ли клонировать голос бесплатно и озвучить свою книгу?

Да, и это не хак. Загружаете образец своего голоса, получаете модель и прогоняете через неё весь текст. Никакой студии, никакого микрофона за тридцать тысяч. Главное — пишите образец в тишине, без эха, иначе клон унаследует комнату вместе с голосом.

Это вообще законно?

Зависит от двух вещей: чей текст и чей голос. Ваш текст плюс ваш голос — вопросов нет. Чужой текст под копирайтом или клон голоса человека без его согласия — нет. Плюс проверьте правила конкретной площадки: часть магазинов требует помечать ИИ-озвучку.

Насколько естественно звучит бесплатный синтез?

Сильно лучше, чем три года назад, но не идеально. Три вещи, которые реально поднимают качество: бейте текст на средние куски (не по одному предложению и не по десять страниц), расставляйте знаки препинания осознанно — точка и запятая управляют паузами, и перебирайте голоса. Первый попавшийся почти никогда не лучший.

Если коротко: возьмите одну главу, прогоните её через синтез речи, послушайте в наушниках на прогулке — и решите, тянет ли это на книгу. У меня тянуло. Через неделю я уже собирал вторую, а туториалы и разборы по озвучке читал просто из интереса. Начните с одной главы сегодня, а не с плана на десять шагов.