AiVoiceDictation (Голосовая диктовка с использованием ИИ)
Автор:- Исходный код дополнения: Посетить Web-сайт aivoicedictation
Краткое описание
AI voice dictation — это комплексный, универсальный голосовой инструмент для NVDA на базе Google Gemini, который превращает вашу речь в отточенный текст и повышает повседневную производительность.
• Диктуйте естественно в любое поле редактирования, используя микрофон и Google Gemini.
• Транскрибируйте аудиофайлы прямо из Проводника.
• Улучшайте текст в буфере обмена с проверкой орфографии и грамматики.
• Обогащайте свои тексты уместным оформлением эмодзи.
• Мгновенно переводите более чем на 100 языков.
Единая многоуровневая система команд NVDA+Alt+Space делает весь инструментарий доступным под рукой.
Несколько ключей API Gemini автоматически чередуются, когда один из них исчерпан.
Диктовку можно приостановить и возобновить, не теряя место.
Любую выполняющуюся операцию можно отменить одним нажатием клавиши.
Текущий статус всегда доступен одним нажатием.
Последнюю запись диктовки можно запустить повторно, если сеть или API прервали её.
Все особенности дополнения подробно описаны в справочном руководстве.
Основная информация
| Название | Версия | Совместимость с API NVDA | Последняя протестированная версия NVDA | Минимальная версия NVDA | Дата загрузки в каталог | Размер | Лицензия |
|---|---|---|---|---|---|---|---|
| aivoicedictation | 2026.1 | 2026.1 | 2026.1.0 | 2026.1.0 | 12-09-2026 07:21:20 | 55 Кб. | GPL v2 |
Журнал изменений
Подробнее
Первоначальный выпуск.
Все особенности описаны в справке.
Скачать
AiVoiceDictation-V.2026.1.nvda-addon
⬇ Перейти к истории версий 🔝 Назад к оглавлениюИнформация о локализации на русский язык
- Локализация от: Разработчик или другой переводчик
- Перевод: Да
- Перевод интерфейса: Да
- Перевод справки: Да
Разделы
🔝 Назад к оглавлениюСправка
Подробнее
AI voice dictation (Голосовая диктовка с использованием ИИ)
AI voice dictation — это комплексный, универсальный голосовой инструмент для NVDA, работающий на базе Google Gemini, который превращает вашу речь в отточенный текст и повышает повседневную производительность. Диктуйте естественно в любое поле редактирования, транскрибируйте аудиофайлы прямо из Проводника, улучшайте текст в буфере обмена с профессиональной проверкой орфографии и грамматики, обогащайте свои тексты уместным оформлением эмодзи и мгновенно переводите более чем на 100 языков.
Каждая функция создана с упором на доступность и эффективность: единая многоуровневая
система команд (NVDA+Alt+Space) делает весь инструментарий доступным под рукой,
несколько ключей API Gemini автоматически чередуются, когда один из них исчерпан,
диктовку можно приостановить и возобновить, не теряя место, любую выполняющуюся
операцию можно отменить одним нажатием клавиши, текущий статус всегда доступен одним
нажатием, а последнюю запись диктовки можно запустить повторно, если сеть или
API прервали её. Пишете ли вы документы, составляете сообщения, работаете с аудиозаписями
или общаетесь на разных языках — AI voice dictation станет вашим голосовым помощником
для повышения производительности, созданным и поддерживаемым в Непале.
- Автор: Bibek Sharma Dhakal
- Версия: 2026.1
- Минимальная протестированная версия NVDA: 2026.1
- Последняя протестированная версия NVDA: 2026.1
Возможности
- Диктуйте непосредственно в любое поле редактирования, используя микрофон и Google Gemini.
- Транскрибируйте аудиофайл, выбранный в Проводнике; результат открывается в окне только для чтения «Транскрибированный текст» с кнопками «Копировать» (Alt+C) и «Закрыть» (Escape также закрывает его).
- Улучшайте (исправляйте орфографию и грамматику) текст, находящийся в данный момент в буфере обмена.
- Форматируйте текст в буфере обмена с помощью эмодзи.
- Переводите текст из буфера обмена на любой из 100+ языков.
- Можно ввести несколько ключей API Gemini, разделённых запятыми; если один ключ не срабатывает (например, из-за исчерпания), следующий ключ пробуется автоматически.
- Приостанавливайте и возобновляйте диктовку, отменяйте выполняющиеся операции, проверяйте статус операции, повторно диктуйте последнюю запись и многое другое — всё из одного слоя команд.
Требования
- NVDA 2026.1 или более поздняя версия.
- Один или несколько ключей API Google Gemini.
- Создайте ключ на https://aistudio.google.com/apikey (или в консоли Google AI for Developers).
- Ключи API хранятся в вашей конфигурации NVDA и по умолчанию скрыты (см. «Показать API» ниже).
Начало работы
- Установите дополнение и перезапустите NVDA.
- Откройте «NVDA» > «Параметры» > «Настройки» и выберите категорию Голосовая диктовка с использованием ИИ.
- Вставьте ваш(и) ключ(и) API Gemini в поле Ключи API Gemini (разделяются запятой). Несколько ключей разделяются запятой, например:
AIza...1111, AIza...2222. - Выберите модель диктовки из комбинированного списка Выберите модель диктовки:. В списке перечислены последние модели Gemini общего назначения (например, Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash Lite, Gemini 2.5 Pro и другие). Чтобы получить точный, актуальный список моделей, доступных для ваших ключей API, нажмите кнопку Получить модели рядом с комбинированным списком — список заполнится моделями, которые сообщает API Gemini, а полученный список будет сохранён.
- При необходимости выберите целевой язык и включите перевод / AI-обработку / форматирование эмодзи.
- Нажмите «OK».
Команды
Дополнение добавляет одну команду в диалог NVDA «Жесты ввода» в категории AI voice dictation:
- Войти в режим команд AI voice dictation — жест по умолчанию:
NVDA+Alt+Space
Нажатие NVDA+Alt+Space заставляет NVDA произнести «Вход в режим команд AI voice
dictation». Следующее одиночное нажатие клавиши затем интерпретируется как команда:
| Клавиша | Действие |
|---|---|
d |
Диктовка. Если вы не находитесь в поле редактирования, NVDA произносит «Пожалуйста, перейдите в любое поле редактирования для диктовки», и ничего не записывается. Если вы находитесь в поле редактирования, запись начинается немедленно («Слушаю...»). Нажмите NVDA+Alt+Space, а затем d снова, чтобы остановить запись и обработать диктовку. Распознанный текст вставляется непосредственно в текущее поле редактирования, а также помещается в буфер обмена, чтобы вы могли вставить его в другое место с помощью Ctrl+V. |
b |
Транскрибировать аудиофайл. Установите фокус на файл (WAV, MP3, M4A, OGG, FLAC, AAC и т. д.) в Проводнике и нажмите NVDA+Alt+Space, а затем b. NVDA произносит «Транскрибирование аудио...» и по завершении открывает окно только для чтения с заголовком «Транскрибированный текст», содержащее транскрипцию. Используйте кнопку «Копировать» (или Alt+C), чтобы скопировать текст в буфер обмена (NVDA произносит «Транскрипция скопирована в буфер обмена.»), и кнопку «Закрыть» или Escape (или кнопку закрытия окна), чтобы закрыть окно. Если фокус не на файле в Проводнике, NVDA произносит «Пожалуйста, установите фокус на любой аудиофайл в Проводнике и попробуйте ещё раз.». Если файл выбран, но он не является поддерживаемым типом аудио, NVDA произносит «Файл не поддерживается.» и ничего не загружается. |
a |
Улучшить текст в буфере обмена (орфография и грамматика). Улучшенный текст копируется обратно в буфер обмена. |
e |
Отформатировать текст в буфере обмена с помощью эмодзи. Результат копируется обратно в буфер обмена. |
t |
Перевести текст из буфера обмена на язык, выбранный в настройках. Перевод копируется обратно в буфер обмена. |
c |
Отменить текущую выполняющуюся операцию. NVDA объявляет отменённую задачу (например, «Диктовка отменено.», «Транскрипция отменено.», «Улучшение отменено.», «Перевод отменено.», «Форматирование эмодзи отменено.»). Отмена диктовки удаляет временное аудио, поэтому диктовку нужно начинать заново с самого начала. Если ничего не выполняется, NVDA произносит «Нет задачи для отмены.» |
p |
Приостановить или возобновить диктовку. Пока идёт запись диктовки, нажатие p произносит «Диктовка приостановлена.», и микрофон останавливается (во время паузы ничего не записывается). Повторное нажатие p произносит «Диктовка возобновлена.», и запись продолжается; аудио после возобновления добавляется к части, записанной до паузы, и всё это транскрибируется вместе по завершении диктовки. Если диктовка не запущена, NVDA произносит «Диктовка не запущена.» |
Enter |
Повторно продиктовать последнюю диктовку. Каждая завершённая запись диктовки сохраняется, поэтому если диктовка не удалась (например, из-за проблемы с сетью или исчерпанного ключа API), нажатие NVDA+Alt+Space, а затем Enter снова отправляет сохранённую запись через конвейер диктовки — не нужно диктовать заново. Повторно продиктованный текст вставляется в поле редактирования и обрабатывается в соответствии с флажками настроек, как и обычная диктовка. Вы должны находиться в поле редактирования: иначе NVDA немедленно произносит «Пожалуйста, перейдите в любое поле редактирования для диктовки», и ничего не отправляется в API. Если диктовка ещё не была записана, NVDA произносит «Диктовка не найдена.» |
u |
Объявить текущий статус. Во время записи NVDA произносит «Диктовка...»; во время паузы — «Диктовка приостановлена.»; пока операция обрабатывается (диктовка, транскрипция, улучшение, форматирование эмодзи или перевод), объявляется соответствующий статус (например, «Транскрибирование...», «Улучшение...»); в противном случае — «Никакая операция не выполняется.» |
i |
Открыть диалог настроек NVDA в категории Голосовая диктовка с использованием ИИ, готовый к изменению ключей API, модели, языка и параметров обработки. Если диалог настроек уже открыт, фокус переводится на него. |
h |
Открыть окно Справка AI voice dictation со списком всех команд. Окно имеет кнопки «Копировать» (или Alt+C) и «Закрыть», точно как окно «Транскрибированный текст». |
| любая другая клавиша | NVDA произносит «Не команда AI voice dictation, попробуйте ещё раз.» |
Настройки
Доступны в «NVDA» > «Параметры» > «Настройки» > «Голосовая диктовка с использованием ИИ»:
- Ключи API Gemini (разделяются запятой): ключ(и) API Google Gemini, используемые для всех операций.
- Показать API: если отмечено, поле ключа API отображается как обычный текст; если не отмечено (по умолчанию), оно маскируется как пароль. Переключение этого параметра изменяет только видимость значения — поле остаётся на месте и сохраняет свою метку.
- Выберите модель диктовки: перечисляет последние модели Gemini (например, Gemini 3.7 Flash, Gemini 3.6 Flash, Gemini 3.5 Flash, Gemini 3.5 Flash Lite, Gemini 2.5 Pro, ...). Выбранная модель используется для каждой операции (диктовка, транскрипция аудио, улучшение, форматирование эмодзи и перевод).
- Получить модели: кнопка рядом с комбинированным списком моделей. Она получает последние модели из API Gemini, используя ключи API в поле выше, заполняет ими комбинированный список и сохраняет полученный список. Ключи не обязательно должны быть уже сохранены — используются те, что введены в данный момент. Во время получения кнопка отключена и снова включается по завершении; если получение не удалось (например, исчерпанные или недействительные ключи, нет соединения), сообщение объясняет причину.
- Переводить после завершения диктовки: если отмечено, продиктованный текст переводится на выбранный целевой язык. По умолчанию не отмечено.
- Выберите целевой язык: язык, используемый для перевода (100+ языков).
- AI-обработка после завершения диктовки: если отмечено (по умолчанию), продиктованный текст исправляется на предмет орфографии и грамматики.
- Форматировать продиктованный текст с помощью эмодзи: если отмечено, в продиктованный текст добавляются подходящие эмодзи. По умолчанию не отмечено.
Мы приветствуем вклад
Мы тепло приветствуем вклад от всех, будь то исправление ошибки, добавление новой функции, улучшение документации или помощь с переводами. Каждый вклад — каким бы малым он ни был — помогает сделать AI voice dictation лучше для всего сообщества.
Если вы столкнётесь с какой-либо проблемой при использовании дополнения, пожалуйста, сообщите о ней, открыв issue в GitHub-репозитории проекта. Укажите как можно больше деталей — шаги для воспроизведения проблемы, любые увиденные сообщения об ошибках и вашу версию NVDA — чтобы её можно было быстро решить. Спасибо, что помогаете нам улучшать!
История версий
История версий
| Версия файла | Тестируемая версия NVDA | Минимальная версия NVDA | Размер файла (КБ) | Ссылка на загрузку |
|---|---|---|---|---|
| 2026.1 | 2026.1.0 | 2026.1.0 | 55 | AiVoiceDictation-V.2026.1.nvda-addon |