NativeSpeechGeneration (Нативная генерация речи)
Автор:- Исходный код дополнения: Посетить Web-сайт NativeSpeechGeneration
Краткое описание
Используйте мощь передового искусственного интеллекта Google Gemini для генерации высококачественной речи непосредственно в NVDA. Это дополнение предоставляет удобный диалог для преобразования текста в естественно звучащее аудио.
Ключевые возможности:
Высококачественные голоса: Выбирайте между Gemini Pro для премиального, реалистичного звучания и Gemini Flash для стандартного качества и быстрой генерации.
Режимы для одного и нескольких говорящих: Легко создавайте аудио для одного говорящего или создавайте динамические диалоги с двумя различными голосами. Просто форматируйте текст как ИмяГоворящего: для назначения голосов.
Расширенное управление голосом: Тонко настраивайте вывод, регулируя параметр температура для более креативных или стабильных результатов, а также задавая пользовательские инструкции по стилю.
Доступный интерфейс: Все элементы управления полностью доступны, включая свёртываемую панель для расширенных настроек, что делает интерфейс чистым и удобным для навигации.
Бесшовный рабочий процесс: Дополнение обеспечивает мгновенное воспроизведение аудио после генерации и позволяет сохранять полученный файл .wav для последующего использования.
Чтобы начать, получите Gemini API-ключ в Google AI Studio и введите его на панели настроек дополнения, которая находится в меню Сервис NVDA.
Сочетание клавиш можно изменить в жестах ввода, в категории «Нативная генерация речи».
Основная информация
| Название | Версия | Совместимость с API NVDA | Последняя протестированная версия NVDA | Минимальная версия NVDA | Дата загрузки в каталог | Размер | Лицензия |
|---|---|---|---|---|---|---|---|
| NativeSpeechGeneration | 1.7.0 | 2026.1 | 2026.1 | 2024.1 | 12-07-2026 06:53:34 | 514 Кб. | GPL v2 |
Журнал изменений
Подробнее
- Совместимость: Добавлена поддержка NVDA 2026.1.
- Зависимости теперь используют последнюю проверенную библиотеку для каждой поддерживаемой версии NVDA.
- Добавлена модель Gemini Flash 3.1 Preview в качестве TTS-модели по умолчанию.
- Полный список изменений см. в файле changelog.md.
Скачать
NativeSpeechGeneration-V.1.7.0.nvda-addon
⬇ Перейти к истории версий 🔝 Назад к оглавлениюИнформация о локализации на русский язык
🔝 Назад к оглавлениюРазделы
🔝 Назад к оглавлениюСправка
Подробнее
Native Speech Generation для NVDA
Автор: Muhammad Gagah muha.aku@gmail.com
Native Speech Generation — это дополнение для NVDA, которое интегрирует Google Gemini AI для генерации высококачественной, естественно звучащей речи непосредственно в NVDA. Оно предоставляет чистый, полностью доступный интерфейс для преобразования текста в аудио, поддерживая как повествование от одного диктора , так и динамические диалоги с несколькими дикторами.
Это дополнение разработано для удобного рабочего процесса, доступного взаимодействия и гибкого управления голосом, подходящего для повествования, диалогов и создания аудиоконтента.
Возможности
Высококачественная генерация речи
-
Выбор между:
-
Gemini Flash 3.1 Preview — мощная, малозадерживающая генерация речи, очень хороша для коротких аудио.
-
Gemini Flash 2.5 — стандартное качество, быстрая генерация, низкая задержка.
-
Gemini Pro 2.5 — премиум-класс, более реалистичные голоса (платная модель).
Режимы одного и нескольких дикторов
- Режим одного диктора для стандартного преобразования текста в речь.
- Режим нескольких дикторов (2 диктора) для диалогов с различными голосами.
Расширенное управление голосом
-
Именование дикторов Назначайте пользовательские имена (например, Джон , Мэри) в режиме нескольких дикторов. ИИ автоматически сопоставляет голоса на основе имён дикторов в сценарии.
-
Инструкции по стилю Предоставляйте подсказки, такие как «Говорите бодрым тоном» или «Рассказывайте спокойно» , чтобы направлять подачу.
-
Управление температурой Регулируйте вариативность и креативность вывода:
-
Меньшие значения → более стабильная и предсказуемая речь.
-
Большие значения → более выразительная и разнообразная речь.
Доступный и чистый интерфейс
- Полностью доступен для экранных диктофонов.
- Расширенные настройки размещены в сворачиваемой панели, чтобы основной диалог оставался простым и сфокусированным.
Бесшовный рабочий процесс
- Аудио воспроизводится автоматически после генерации.
- Сгенерированное аудио можно воспроизвести заново или сохранить как высококачественный
.wav-файл. - Разработано для минимального трения при многократной генерации и воспроизведении.
Умная загрузка голосов и кэширование
- Доступные голоса динамически получаются из Gemini API.
- Данные голосов кэшируются на 24 часа для уменьшения количества вызовов API и ускорения запуска.
Разговор с ИИ (Живой диалог)
-
Голосовой чат в реальном времени : Ведите естественный разговор с Gemini с низкой задержкой.
-
Привязка к Google Search : Включите возможность для ИИ получать актуальную информацию из интернета во время вашего чата.
-
Возможность прерывания : Вы можете прервать ИИ в любой момент, заговорив или нажав «Остановить диалог».
-
Настраиваемость : Использует выбранный вами голос и инструкции по стилю.
-
Управление уровнем мышления : Выберите
No Thinking(Без мышления),Low(Низкий),Medium(Средний) илиHigh(Высокий) в зависимости от желаемой глубины рассуждений. -
Непрерывность при переподключении : Недавний контекст разговора автоматически восстанавливается после переподключения, без отдельного переключателя памяти.
-
Более стабильная потоковая передача : Улучшено поведение при переподключении (экспоненциальная задержка + повторные попытки) и адаптивная буферизация аудио для лучшей устойчивости при нестабильных сетях.
-
-
Требования
-
NVDA 2024.1 или новее, протестировано до NVDA 2026.1.
-
Активное подключение к интернету.
-
Действительный ключ Google Gemini API.
-
-
Установка
- Загрузите последний пакет дополнения со страницы релизов: https://github.com/MuhammadGagah/native-speech-generation/releases
- Установите его как стандартное дополнение NVDA.
- Перезапустите NVDA при появлении запроса.
Настройка ключа API (Обязательно)
- Создайте ключ API в Google AI Studio : https://aistudio.google.com/apikey
- Откройте NVDA и перейдите в: Меню NVDA → Сервис → Native Speech Generation
- Нажмите «Настройки ключа API».
- Это откроет настройки NVDA непосредственно в категории Native Speech Generation.
- Вставьте ваш ключ Gemini API в поле GEMINI API Key.
- Нажмите OK , чтобы сохранить.
Сохранённые ключи хранятся в безопасности с помощью Windows DPAPI , поэтому зашифрованное значение не может быть расшифровано на другом компьютере с Windows или учётной записи пользователя.
Для расширенных развёртываний вы также можете предоставить ключ через
переменную окружения GEMINI_API_KEY. Дополнение будет использовать его
автоматически, если сохранённый ключ отсутствует.
Как использовать
Откройте диалог с помощью:
- NVDA+Control+Shift+G , или
- Меню NVDA → Сервис → Native Speech Generation
Основные элементы интерфейса
-
Текст для преобразования Введите или вставьте текст, который вы хотите преобразовать в речь.
-
Инструкции по стилю (необязательно) Предоставьте указания по тону, эмоциям или манере подачи.
-
Выбор модели
-
Flash 3.1 Preview
-
Flash 2.5
-
Pro 2.5 (Высокое качество)
-
Режим диктора
-
Один диктор
-
Несколько дикторов (2)
-
-
Генерация речи
Режим одного диктора
- Выберите Один диктор.
- Выберите голос из раскрывающегося списка Выберите голос.
- Введите ваш текст.
- При желании добавьте инструкции по стилю.
- Нажмите Сгенерировать речь.
- Аудио воспроизведётся автоматически после генерации.
Режим нескольких дикторов
-
Выберите Несколько дикторов (2).
-
Для каждого диктора:
-
Введите уникальное Имя диктора.
-
Выберите отдельный Голос.
-
Отформатируйте текст так, чтобы каждая строка начиналась с имени диктора, за которым следует двоеточие.
Пример:
Алиса: Привет, Боб, как у тебя дела сегодня? Боб: У меня всё отлично, Алиса! Погода замечательная.
- Нажмите Сгенерировать речь. Голоса будут назначены автоматически на основе имён дикторов.
Разговор с ИИ (Живой режим)
Ведите естественный двусторонний голосовой разговор с Gemini.
- Настройте желаемый Голос и Инструкции по стилю в основном диалоге. (Примечание: «Разговор с ИИ» в настоящее время поддерживает только режим одного диктора)
- Нажмите Разговор с ИИ.
- В новом окне:
- Начать диалог : Начинает сеанс. Говорите в микрофон.
- Остановить диалог : Завершает сеанс.
- Привязка к Google Search : Установите этот флажок, чтобы разрешить Gemini искать ответы в интернете (например, текущие новости, погоду).
- Примечание: Этот флажок скрыт, пока активен диалог. Остановите диалог, чтобы изменить его.
- Уровень мышления : Выберите
No Thinking(Без мышления),Low(Низкий),Medium(Средний) илиHigh(Высокий). - Переключение микрофона : Включите/выключите микрофон.
- Громкость : Регулируйте громкость воспроизведения голоса ИИ.
Расширенные настройки
-
Включите Расширенные настройки (Температура) , чтобы отобразить ползунок.
-
Диапазон температуры :
-
0.0→ Наиболее детерминированный и стабильный. -
1.0→ Баланс по умолчанию. -
2.0→ Наиболее креативный и разнообразный. -
-
Обзор кнопок
-
Сгенерировать речь — Начать генерацию речи.
-
Воспроизвести — Воспроизвести последнее сгенерированное аудио.
-
Разговор с ИИ — Открыть интерфейс голосового диалога в реальном времени.
-
Сохранить аудио — Сохранить последнее аудио как
.wav-файл. -
Настройки ключа API — Открыть конфигурацию дополнения в настройках NVDA.
-
Просмотреть голоса в AI Studio — Открывает Google AI Studio в браузере.
-
Закрыть — Закрыть диалог (или нажмите
Escape). -
-
Жесты ввода
Настраивается через: Меню NVDA → Параметры → Жесты ввода → Native Speech Generation
Жест по умолчанию:
-
NVDA+Control+Shift+G — Открыть диалог Native Speech Generation.
-
-
Руководство по разработке и внесению вклада
Если вы хотите разрабатывать или модифицировать это дополнение, выполните следующие шаги.
Настройка окружения
- Python, соответствующий вашей целевой среде выполнения NVDA
- Используйте Python 3.13 64-bit при тестировании или упаковке зависимостей для NVDA 2026.1 и новее.
- Используйте Python 3.11 32-bit только при упаковке зависимостей для старых поддерживаемых сборок NVDA.
- uv для закреплённой сборки и цепочки инструментов линтинга.
uv sync uv run pre-commit run --all-files uv run scons uv run scons pot
SCons 4.10.1, Markdown 3.10, Ruff 0.14.10, Pyright 1.1.407 и другие
инструменты сборки устанавливаются из uv.lock. * GNU Gettext Tools
(опционально, рекомендуется для локализации)
- Обычно предустановлены в Linux/Cygwin.
- Windows: https://gnuwin32.sourceforge.net/downlinks/gettext.php
Дополнительные зависимости
Только для локальной разработки установите зависимости «Разговора с ИИ» (только аудио) напрямую в путь библиотеки дополнения, используя версию Python и архитектуру, соответствующие тестируемой среде выполнения NVDA:
python.exe -m pip install google-genai pyaudio --target "D:/myAdd-on/Native- Speech-Generation/addon/globalPlugins/NativeSpeechGeneration/lib"
Откорректируйте путь в соответствии с вашей локальной директорией исходного кода дополнения.
Для текущей реализации «Разговора с ИИ» (только аудио) вам не нужны opencv- python, pillow или mss.
Для релизных пакетов дополнение загружает последний проверенный архив зависимостей на основе запущенной версии NVDA:
lib.zipдля NVDA 2025.3.3 и старых поддерживаемых сборок.lib64.zipдля NVDA 2026.1 и новее.
Дополнение считывает SHA-256 данные из последнего релиза зависимостей на
GitHub, используя дайджест релизного ассета или файлы контрольных сумм.
Встроенные утверждённые контрольные суммы сохраняются только как запасной
вариант для первой установки, когда поиск последнего релиза не удаётся. Ручная
переустановка библиотек требует последнего проверенного релиза. Извлечённая
папка всегда устанавливается как
addon/globalPlugins/NativeSpeechGeneration/lib.
Затем скопируйте следующее из вашей установки Python в:
addon/globalPlugins/NativeSpeechGeneration/lib
-
папку
zoneinfo -
файл
secrets.py -
-
Внесение вклада
Приветствуются вклад, предложения и сообщения об ошибках.
- Откройте Issue для ошибок или запросов функций.
- Отправьте Pull Request для внесения кода.
Контакты
- Email:
muha.aku@gmail.com - GitHub: https://github.com/MuhammadGagah
История версий
История версий
| Версия файла | Тестируемая версия NVDA | Минимальная версия NVDA | Размер файла (КБ) | Ссылка на загрузку |
|---|---|---|---|---|
| 1.7.0 | 2026.1 | 2024.1 | 514 | NativeSpeechGeneration-V.1.7.0.nvda-addon |
| 1.6.0 | 2025.3.3 | 2024.1 | 481 | NativeSpeechGeneration-V.1.6.0.nvda-addon |
| 1.5.5 | 2025.3.2 | 2024.1 | 453 | NativeSpeechGeneration-V.1.5.5.nvda-addon |
| 1.5.4 | 2025.3.2 | 2024.1 | 440 | NativeSpeechGeneration-V.1.5.4.nvda-addon |
| 1.5.3 | 2025.3.2 | 2024.1 | 436 | NativeSpeechGeneration-V.1.5.3.nvda-addon |
| 1.5.2 | 2025.3.2 | 2024.1 | 436 | NativeSpeechGeneration-V.1.5.2.nvda-addon |
| 1.5.1 | 2025.3.2 | 2024.1 | 435 | NativeSpeechGeneration-V.1.5.1.nvda-addon |
| 1.5 | 2025.3.2 | 2024.1 | 432 | NativeSpeechGeneration-V.1.5.nvda-addon |
| 1.3 | 2025.3.2 | 2024.1 | 66 | NativeSpeechGeneration-V.1.3.nvda-addon |
| 1.2 | 2025.2 | 2023.1 | 54 | NativeSpeechGeneration-V.1.2.nvda-addon |
| 1.0 | 2025.1 | 2023.1 | 8184 | NativeSpeechGeneration-V.1.0.nvda-addon |