TTSConverter (Конвертер Текст в Речь)
Автор:- Исходный код дополнения: Посетить Web-сайт tts_converter
Краткое описание
Дополнение TTSConverter для NVDA позволяет озвучивать текст с помощью двух популярных провайдеров синтеза речи: Gemini и ElevenLabs.
В верхней части окна вы можете переключаться между провайдерами, и интерфейс автоматически подстроится под выбранный сервис.
Для Gemini доступны как обычная озвучка, так и режим подкаста с двумя собеседниками.
Вы можете выбрать голос из выпадающего списка и отфильтровать их по полу.
Для более выразительной речи доступна вставка эмоциональных тегов прямо в текст.
В режиме подкаста вы задаёте два голоса и имена для спикеров, а затем пошагово строите диалог.
После создания сценария вы можете сгенерировать аудио, прослушать его, сохранить на диск или открыть папку с файлом.
В настройках Gemini вы указываете свой API‑ключ и выбираете одну из трёх моделей озвучки.
ElevenLabs предлагает более широкие возможности для работы с голосами.
Для озвучки вы можете выбрать из вашей личной библиотеки голосов, отфильтровав их по полу.
В режиме подкаста экран делится на две половины для каждого собеседника.
Вы можете добавлять реплики по очереди или вставить готовый сценарий в формате «Имя: текст».
После этого плагин найдет всех говорящих и позволит назначить каждому уникальный голос.
Для ElevenLabs доступно клонирование голосов, а также вы можете узнать остаток кредитов вашего аккаунта.
Выбор провайдера и все настройки сохраняются между сеансами работы.
Для быстрого переключения между провайдерами используйте сочетания клавиш Ctrl+Tab и Ctrl+Shift+Tab.
Вы можете назначить собственную горячую клавишу для открытия дополнения через меню жестов NVDA.
Для работы необходимы собственные API-ключи для обозначенных сервисов.
Все особенности дополнения описаны в справочном руководстве.
Основная информация
| Название | Версия | Совместимость с API NVDA | Последняя протестированная версия NVDA | Минимальная версия NVDA | Дата загрузки в каталог | Размер | Лицензия |
|---|---|---|---|---|---|---|---|
| tts_converter | 1.2 | 2026.1 | 2026.1 | 2019.3 | 01-09-2026 20:21:02 | 33 Кб. | GPL v2 |
Журнал изменений
Подробнее
Первоначальный выпуск.
Все особенности описаны в справочном руководстве.
Скачать
⬇ Перейти к истории версий 🔝 Назад к оглавлениюИнформация о локализации на русский язык
- Локализация от: Разработчик или другой переводчик
- Перевод: Да
- Перевод интерфейса: Да
- Перевод справки: Да
Разделы
🔝 Назад к оглавлениюСправка
Подробнее
Конвертер Текст-в-Речь
Раздел Gemini
Когда выбираете Gemini, можно сделать обычную озвучку текста или подкаст с двумя голосами.
Для обычной озвучки — выпадающий список, где выбираете голос, и рядом список "Фильтр по полу" — все голоса, только мужские или только женские. Рядом кнопка для эмоциональных тегов: нажимаете, выбираете тег, потом пишете текст. Если дальше по тексту хочется ещё одну эмоцию — снова нажимаете кнопку, выбираете следующий тег, пишете дальше. Так можно чередовать сколько угодно раз.
Для подкаста появляются два выпадающих списка голосов — свой для первого собеседника, свой для второго. У каждого голоса можно, по желанию, задать своё имя (по умолчанию "Спикер1" и "Спикер2"). Дальше — одно поле ввода, куда пишете саму реплику, без имени. Под ним — две кнопки, подписанные именами ваших собеседников. Написали реплику, нажали нужную кнопку — она добавляется в общий сценарий уже с именем говорящего, а поле ввода очищается для следующей фразы. Так по очереди строите весь диалог.
Ниже — необязательное поле для названия файла. Дальше кнопки: "Создать Аудио", "Воспроизвести", "Сохранить" и "Открыть папку" — чтобы сразу найти готовый файл на диске.
Кнопка настроек открывает окно, где вставляете ключ API Gemini, сохраняете, сбрасываете, переходите на сайт за новым ключом, и выбираете одну из моделей озвучки. Моделей три: одна точно бесплатная (Gemini 3.1 Flash TTS Preview), и ещё две — Gemini 2.5 Flash Preview TTS и Gemini 2.5 Pro Preview TTS — на платном тарифе, качество озвучки у них выше.
Раздел ElevenLabs
Когда выбираете ElevenLabs, точно так же можно сделать обычную озвучку текста или подкаст с двумя голосами.
Вверху окна — список "Режим генерации": "Текст в Аудио" или "Подкаст (два голоса)". От выбора зависит, какие поля видны ниже.
В списке моделей каждая сама описывает, что умеет. Например: "Eleven v3 — самая выразительная. Поддерживает подкаст, не поддерживает регулировку скорости речи и сходства голоса." Остальные модели, наоборот, поддерживают ползунки скорости и сходства, но не поддерживают подкаст.
Качество итогового аудио подбирается автоматически, без какого-либо участия — по тарифу вашего ключа ElevenLabs. На тарифах Creator и выше используется более высокое качество (192 кбит/с), на бесплатном и начальном тарифе — обычное (128 кбит/с). Действует и для обычной озвучки, и для подкаста.
Для обычной озвучки — фильтр по полу, список голосов (тянется прямо из вашей личной библиотеки ElevenLabs, а не из фиксированного набора, как у Gemini), поле для текста со счётчиком символов под ним, и кнопка "Прослушать голос" — можно заранее услышать выбранный голос до самой генерации. Список "Режим" — Стабильный, Сбалансированный или Креативный — виден и работает в обоих режимах генерации, и в обычной озвучке, и в подкасте.
Для подкаста экран делится на две одинаковые половины — для первого собеседника и для второго. У каждого свои: фильтр по полу голоса, список голосов, кнопка "Прослушать голос", и поле для имени.
Ниже — общее поле для одной реплики и две кнопки с именами собеседников. Что вписано в поле имени, так и называется кнопка, и ровно это имя попадает в сценарий. Пустое поле имени — кнопка называется "Спикер 1" или "Спикер 2". Эти же две кнопки позволяют получить куда больше двух голосов — до десяти: если между нажатиями менять имя, каждое новое имя получает свой собственный голос, а повтор уже использованного имени всегда возвращает тот же голос, что был закреплён за ним раньше.
Второй способ — написать или вставить весь готовый сценарий сразу, без пошагового нажатия кнопок. Пишете: имя, например Катя, двоеточие, и сразу текст, который должна произнести Катя. Потом — новая строка, снова имя, например Антон, снова двоеточие, и его текст. И так по кругу, сколько нужно реплик. Такой сценарий, кстати, легко попросить составить любую нейросеть, просто объяснив ей этот же формат.
Когда сценарий готов, нажимается кнопка "Голоса по сценарию". Плагин находит в тексте все разные имена и показывает список — каждое имя отдельной кнопкой, одна под другой. Нажимаете на имя — открывается окно выбора голоса именно для него: список фильтра по полу (по умолчанию мужской), под ним список голосов, ниже кнопка "Прослушать", и ниже неё "Готово". Выбрали голос, нажали "Готово" — окно закрывается, а кнопка этого имени в общем списке сразу показывает, какой голос выбран. Проходите так по каждому найденному имени. Когда все имена разобраны, внизу общего списка — "Назад" и общее "Готово", которое сохраняет разом все выбранные голоса.
Счётчик символов под сценарием считает только сами реплики, без имён, лимит — две тысячи символов. Работает подкаст только с моделью Eleven v3.
Голоса можно не только выбирать готовые, но и клонировать: кнопка "Мои голоса" открывает список ваших клонированных голосов с возможностью выбрать любой или удалить, и кнопку, чтобы клонировать новый — выбираете аудиофайл с образцом, даёте имя. Важно: клонирование недоступно на бесплатном тарифе ElevenLabs, на нём работают только готовые голоса из библиотеки.
Дальше — общие кнопки, как у Gemini: имя файла, "Создать Аудио", "Воспроизвести", "Сохранить", "Открыть папку", "Очистить", "Настройки API", "Закрыть".
В окне настроек, рядом с кнопками "Сохранить" и "Сбросить", есть кнопка "Узнать лимит". Она открывает состояние вашего аккаунта ElevenLabs: сколько кредитов потрачено, сколько кредитов доступно всего, сколько кредитов осталось, и дату, когда лимит обнулится.
Переключение и запуск
Вверху окна есть список "Провайдер". Открыли список, выбрали нужную нейросеть — окно перестраивается под неё, а выбор запоминается: в следующий раз откроете дополнение — там уже будет стоять та нейросеть, с которой вы закончили работать в прошлый раз.
Переключаться можно и не открывая список: Ctrl+Tab — на следующую нейросеть по кругу, Ctrl+Shift+Tab — на предыдущую. Работают из любого места окна.
У этого дополнения нет горячей клавиши для открытия окна по умолчанию — назначьте свою через меню NVDA: "Настройки" — "Жесты ввода...", найдите там пункт "Открыть конвертер текста в речь" в категории "Конвертер Текст-в-Речь", и назначьте удобное вам сочетание клавиш.
Контакты
Чтобы отблагодарить меня или со мной связаться — Telegram. @Kvarkovyj_Zvuk
Почта Gmail. a45951011@gmail.com
История версий
История версий
| Версия файла | Тестируемая версия NVDA | Минимальная версия NVDA | Размер файла (КБ) | Ссылка на загрузку |
|---|---|---|---|---|
| 1.2 | 2026.1 | 2019.3 | 33 | TTSConverter-V.1.nvda-addon |