Перейти к основному содержимому Главная страница каталога дополнений для NVDA от русскоязычного сообщества NVDA.RU.

Официальный русскоязычный каталог дополнений NVDA

Крупнейший каталог дополнений для программы экранного доступа NVDA, доступный в Интернете

Каталог дополнений от «🇷🇺 Русскоязычного сообщества NVDA.RU.»

OnnxASR (Диктовка и голосовой ввод с применением моделей Сбера GigaAM)

Автор:

Краткое описание

OnnxASR — это дополнение для распознавания речи и голосового ввода с использованием моделей Сбера GigaAM V3.
Вы можете скачать основной движок и одну из двух квантованных моделей (CTC или RNNT) с Яндекс Диска автора (ссылка в справке).
После установки движка и модели назначьте сочетание клавиш для запуска диктовки в диалоге «Жесты ввода».
Запуск диктовки активирует запись с микрофона, а повторный вызов завершит запись и поместит распознанный текст в буфер обмена.
Первый запуск диктовки в текущей сессии NVDA требует нескольких секунд на инициализацию модели, в течение которых NVDA может временно зависнуть.
Последующие запуски происходят мгновенно.
Настройки дополнения открываются через меню NVDA «Инструменты» и «Настройки Onnx ASR».
В настройках есть режим «Использовать голосовой ввод» для непрерывного распознавания и отправки текста в виде команд NVDA.
В этом режиме вы можете назначать собственные голосовые команды на любые скрипты в диалоге «Жесты ввода».
Например, вы можете привязать фразу «Сколько времени» к команде чтения текущего времени.
После сохранения настроек голосовая команда будет работать как обычное сочетание клавиш.
Дополнение поддерживает две архитектуры моделей распознавания.
CTC работает немного быстрее, но может быть менее точным по сравнению с RNNT-версией.
Для разделения записи на фрагменты используется Silero VAD.
По умолчанию границей между предложениями считается тишина длительностью 300 мс.
Это значение может быть слишком малым для медленной диктовки, но будет настраиваемым в следующих версиях.
На Яндекс Диск также доступны полноценные неквантованные версии моделей без суффикса int8.
Они занимают в четыре раза больше места, но обеспечивают более высокое качество распознавания.
Дополнение OnnxASR предоставляет современные возможности голосового управления и диктовки на русском языке.
Оно подходит для набора текста, управления компьютером и создания собственных голосовых сценариев.
OnnxASR — это мощное решение для автоматизации работы с помощью голоса.

⬇ Перейти к подробной справке 🔝 Назад к оглавлению

Основная информация

Название Версия Совместимость с API NVDA Последняя протестированная версия NVDA Минимальная версия NVDA Дата загрузки в каталог Размер Лицензия
OnnxASR 2026.07.30 2026.1 2026.1 2026.1 01-08-2026 18:16:46 30976 Кб. GPL v2
🔝 Назад к оглавлению

Журнал изменений

Подробнее

Из изменений можно отметить следующее:



  1. В диалоге настроек добавлена опция «Минимальная тишина между предложениями при диктовке», позволяющая указать минимальную паузу в режиме диктовки, которую детектор активности голоса будет воспринимать как границу между предложениями. Значение по умолчанию — 600 миллисекунд. Допустимые значения — от 100 до 2000 мс.

  2. Обновлены внешние зависимости: onnxruntime 1.28.0 и onnx_asr 0.12.0.

🔝 Назад к оглавлению

Скачать

OnnxASR-V.2026.07.30.nvda-addon

⬇ Перейти к истории версий 🔝 Назад к оглавлению

Информация о локализации на русский язык

🔝 Назад к оглавлению

Разделы

🔝 Назад к оглавлению

Справка

Подробнее

OnnxASR (Диктовка и голосовой ввод с применением моделей Сбера GigaAM)

Примечание от руководителя русскоязычного сообщества: Если вам понравилось это дополнение или любое другое от Кварка, и вы хотите выразить благодарность его автору, то сделать это можно переводом любой суммы на следующий кошелёк YooMoney: https://yoomoney.ru/to/410012293543375 Уверен, ему будет приятно.

О дополнении:

Вот всё-таки доделал дополнение для диктовки и голосового ввода с применением моделей Сбера GigaAM V3. Взять основной движок и пару квантованных моделей (ctc/rnnt) можно с Яндекс Диска (подкаталог OnnxASR): https://disk.yandex.ru/d/uVPpHVwcI4tBAQ

Версия 2026.07.30

Дополнение для диктовки и голосового ввода OnnxASR обновлено до версии 2026.07.30. Из изменений можно отметить следующее:

  1. В диалоге настроек добавлена опция «Минимальная тишина между предложениями при диктовке», позволяющая указать минимальную паузу в режиме диктовки, которую детектор активности голоса будет воспринимать как границу между предложениями. Значение по умолчанию — 600 миллисекунд. Допустимые значения — от 100 до 2000 мс.
  2. Обновлены внешние зависимости: onnxruntime 1.28.0 и onnx_asr 0.12.0.

Это дополнение основано на Python-пакете onnx_asr и может работать со всеми ONNX-моделями, которые поддерживает onnx_asr. Их полный список приведён на следующей странице: https://istupakov.github.io/onnx-asr/usage/#supported-model-names У меня на Яндекс Диске лежат только модели GigaAM V3 — они наиболее актуальны для русского языка. При этом любой желающий может собрать и все остальные поддерживаемые модели в форме дополнений (Whisper, Vosk и т. д.).

Расшифровка речи выполняется с помощью ONNX-моделей с инференсом на ЦП. Подключение к интернету не требуется. Всё работает локально на вашей машине без регистрации и SMS. https://t.me/nvda_group/72100

Мультиязычные модели, в том числе Whisper Large v3, самостоятельно определяют язык речи на записи. В настройках OnnxASR можно выбрать только используемую модель. https://t.me/nvda_group/72101

whisper-large-v3-turbo-int8.

Вот для теста собрал сейчас аддон с Whisper Large v3 Turbo. С английским справляется весьма недурно, с русским — хуже, ну а с турецким проверьте сами. Если брать только русский язык, то модели GigaAM V3 заметно лучше как по качеству, так и по скорости работы.

https://t.me/nvda_group/72106

Версия: 2026.07.12

После установки движка и хотя бы одной модели необходимо в диалоге «Жесты ввода» назначить своё сочетание клавиш на команду запуска или остановки диктовки (см. категорию Onnx ASR). Запуск диктовки активирует запись с микрофона. Повторный вызов завершит запись и поместит распознанную речь в буфер обмена. Прошу обратить внимание, что первый запуск диктовки в текущей сессии работы NVDA требует нескольких секунд на первоначальную инициализацию модели, в течение которых NVDA будет находиться в зависшем состоянии. Последующие запуски будут происходить мгновенно. Настройки можно открыть через меню NVDA → Инструменты → Настройки Onnx ASR.

https://t.me/nvda_group/71429

Ещё в диалоге настроек Onnx ASR имеется флажок «Использовать голосовой ввод». Если его установить и сохранить изменения кнопкой OK, дополнение начнёт непрерывно распознавать речь с микрофона и отправлять распознанный текст в виде команд ввода NVDA. В этом режиме пользователь сможет назначать свои голосовые команды на произвольные скрипты в диалоге «Жесты ввода». Например, можно найти команду чтения текущего времени, нажать кнопку «Добавить», а затем произнести фразу «Сколько времени». Через пару мгновений команда привяжется к выбранному скрипту. После сохранения изменений кнопкой OK пользователь сможет в любой момент узнавать текущее время, просто произнеся в микрофон фразу «Сколько времени», — точно так же, как и с помощью сочетания NVDA+F12.

Это две разные архитектуры моделей. CTC работает чуть быстрее, но может выдавать менее точный текст по сравнению с RNNT-версией. Если на ваших аудиозаписях разницы не видно, то используйте любую из них.

Разделение записи на фрагменты выполняет Silero VAD. Сейчас по умолчанию границей между предложениями считается тишина длительностью 300 мс и более, что, вероятно, при медленной диктовке — слишком малое значение. В следующей версии вынесу данный параметр в диалог настроек. Правда, Silero VAD — это тоже российская разработка. Боюсь, как бы вам окончательно не поплохело от осознания того, что российские разработчики тоже умеют делать очень крутые вещи.

На Яндекс Диск залил полноценные неквантованные версии моделей (без суффикса int8 в имени). На диске и в памяти они занимают почти в четыре раза больше места, но и качество финального текста должно быть немного лучше.

🔝 Назад к оглавлению

История версий

История версий
Версия файлаТестируемая версия NVDAМинимальная версия NVDAРазмер файла (КБ)Ссылка на загрузку
2026.07.302026.12026.130976OnnxASR-V.2026.07.30.nvda-addon
2026.07.122026.12026.126888OnnxASR-V.2026.07.12.nvda-addon
🔝 Назад к оглавлению