GeminiDictation (Диктовка Gemini)
Автор:- Исходный код дополнения: Посетить Web-сайт Gemini Dictation
Краткое описание
Дополнение GeminiDictation для NVDA, позволяющее преобразовывать голос в текст с помощью искусственного интеллекта.
Поддерживает провайдеры Gemini от Google и Groq с выбором различных моделей распознавания.
Для работы требуется ключ API выбранного провайдера и подключение к интернету.
Управление осуществляется с помощью горячих клавиш.
Запись запускается и останавливается одной комбинацией клавиш.
Расшифрованный текст автоматически вставляется в активное окно.
Доступна настройка инструкции для улучшения качества распознавания.
Дополнение запоминает последний вставленный текст и предотвращает повторы.
Интегрируется в стандартные настройки NVDA для удобного конфигурирования.
Подходит для быстрых заметок, деловой переписки и творческих задач.
Примечание: Интегрировал в код возможность для локализации.
Основная информация
| Название | Версия | Совместимость с API NVDA | Последняя протестированная версия NVDA | Минимальная версия NVDA | Дата загрузки в каталог | Размер | Лицензия |
|---|---|---|---|---|---|---|---|
| Gemini Dictation | 0.3 | 2026.1 | 2026.1.0 | 2023.1.0 | 03-07-2026 23:10:52 | 26 Кб. | GPL v2 |
Журнал изменений
Подробнее
Не найдено
Скачать
GeminiDictation-V.0.3.nvda-addon
⬇ Перейти к истории версий 🔝 Назад к оглавлениюИнформация о локализации на русский язык
🔝 Назад к оглавлениюРазделы
🔝 Назад к оглавлениюСправка
Подробнее
Руководство по дополнению GeminiDictation
Что такое GeminiDictation
GeminiDictation — это дополнение для программы экранного доступа NVDA, которое позволяет преобразовывать голосовые сообщения в текст с помощью искусственного интеллекта. Дополнение использует API сервисов Gemini от Google или Groq для распознавания речи и автоматической вставки расшифрованного текста в активное окно или поле ввода.
С помощью этого дополнения вы можете быстро диктовать текст, не переключаясь между приложениями и не используя клавиатуру. Это особенно полезно для людей с ограниченными возможностями, а также для всех, кто хочет ускорить процесс ввода текста.
Основные возможности
- Голосовая диктовка с автоматическим распознаванием речи
- Поддержка двух провайдеров: Gemini и Groq
- Выбор различных моделей для распознавания
- Автоматическая вставка расшифрованного текста в активное окно
- Настраиваемая инструкция для улучшения качества распознавания
- Простое управление с помощью горячих клавиш
- Полная интеграция с настройками NVDA
Начало работы
Требования
Для работы дополнения необходимо:
- Установленная программа NVDA (версия не ниже 2023.1)
- Активный интернет-канал
- Ключ API для выбранного провайдера (Gemini или Groq)
- Микрофон для записи голоса
Получение API ключей
Для Gemini (Google)
- Перейдите на сайт Google AI Studio: https://makersuite.google.com/app/apikey
- Войдите под своей учётной записью Google
- Нажмите кнопку «Создать ключ API» (Create API Key)
- Скопируйте полученный ключ
- Вставьте ключ в настройки дополнения
Для Groq
- Перейдите на сайт Groq Cloud: https://console.groq.com/keys
- Зарегистрируйтесь или войдите в систему
- Нажмите кнопку «Create API Key»
- Укажите имя для ключа и нажмите «Create»
- Скопируйте полученный ключ
- Вставьте ключ в настройки дополнения
Настройка дополнения
Чтобы открыть настройки GeminiDictation, нажмите комбинацию клавиш Control+Shift+G или откройте меню NVDA → Параметры → Настройки → Gemini Dictation.
В окне настроек доступны следующие параметры:
Провайдер
Выберите сервис для распознавания речи:
- Gemini — использует модели Google для расшифровки аудио
- Groq — использует модели Groq для расшифровки аудио
Настройки для Gemini
- Gemini API Key — ключ API, полученный от Google AI Studio
- Gemini Model — выбор модели Gemini для распознавания:
- gemini-2.5-flash — быстрая модель для повседневных задач
- gemini-2.5-flash-lite — облегчённая версия
- gemini-2.5-pro — мощная модель для сложных задач
- gemini-2.0-flash — предыдущее поколение быстрых моделей
- gemini-2.0-flash-lite — облегчённая версия
- gemini-1.5-flash — более старая версия
- gemini-1.5-pro — профессиональная версия
- gemini-1.5-flash-8b — оптимизированная версия
- gemini-3.1-flash-lite — новейшая облегчённая модель
- gemini-3.1-flash-lite-preview — предварительная версия
Настройки для Groq
- Groq API Key — ключ API, полученный от Groq Cloud
- Groq Model — выбор модели Groq:
- whisper-large-v3 — основная модель для распознавания
- whisper-large-v3-turbo — ускоренная версия
Инструкция
В поле «Инструкция» вы можете указать дополнительные указания для модели искусственного интеллекта. Например:
- «Расшифруй эту аудиозапись на русском языке»
- «Транскрибируй аудио и отформатируй текст с абзацами»
- «Распознай речь и исправь грамматические ошибки»
Если поле инструкции оставлено пустым, дополнение будет использовать стандартный запрос, который включает правильную пунктуацию.
Использование дополнения
Основная команда
Для начала записи голоса нажмите комбинацию клавиш Control+Shift+D. Дополнение начнёт запись с микрофона, вы услышите короткий звуковой сигнал и сообщение «Слушаю...».
Говорите чётко и размеренно. После завершения речи снова нажмите Control+Shift+D. Вы услышите другой звуковой сигнал и сообщение «Обрабатываю...».
Дополнение отправит запись на сервер выбранного провайдера, дождётся расшифровки и автоматически вставит полученный текст в активное окно или поле ввода. После успешной вставки вы услышите сообщение «Готово. Текст вставлен.»
Открытие настроек
Для быстрого доступа к настройкам дополнения используйте комбинацию Control+Shift+G. Это откроет окно настроек NVDA с уже выбранной панелью Gemini Dictation.
Особенности работы
- Текст автоматически вставляется через буфер обмена с использованием метода вставки (Paste)
- Если основной метод вставки не сработал, дополнение использует резервный способ через PowerShell
- Дополнение запоминает последний вставленный текст и не будет вставлять его повторно, если результат расшифровки совпадает с предыдущим
- Запись автоматически останавливается при закрытии NVDA
Советы по улучшению качества распознавания
Для пользователей
- Говорите чётко и в спокойном темпе
- Используйте качественный микрофон
- Минимизируйте фоновый шум во время записи
- Разделяйте длинные предложения паузами
- При необходимости используйте инструкцию для указания языка или стиля текста
Настройка инструкции
Инструкция позволяет значительно улучшить качество расшифровки. Вот несколько примеров эффективных инструкций:
Для деловых писем: «Расшифруй аудиозапись в формате делового письма. Используй официальный стиль, правильную пунктуацию и абзацы.»
Для заметок: «Транскрибируй речь в виде кратких заметок. Разбивай текст на пункты. Используй ключевые слова вместо полных предложений.»
Для творческих текстов: «Расшифруй аудио и придай тексту литературный стиль. Исправь речевые ошибки и добавь выразительности.»
Для многоязычной речи: «Распознай речь, определи язык автоматически и сохрани все языки в расшифровке.»
Выбор модели
Разные модели подходят для разных задач:
- Flash-модели — для быстрой расшифровки коротких сообщений
- Pro-модели — для длинных и сложных аудиозаписей
- Lite-модели — когда важна экономия ресурсов и скорость
Возможные проблемы и решения
Ошибка «API ключ не задан»
Убедитесь, что вы правильно скопировали и вставили ключ API в настройки дополнения. Проверьте, не попали ли лишние пробелы.
Ошибка «Неверный ключ»
Ключ API может быть недействительным или истекшим. Проверьте ключ на сайте провайдера и при необходимости создайте новый.
Ошибка сети
Проверьте подключение к интернету. Убедитесь, что брандмауэр или антивирус не блокируют доступ к API сервисам.
Пустой результат
Если дополнение возвращает пустой результат, попробуйте:
- Проверить качество записи — микрофон должен быть включён и правильно настроен
- Убедиться, что вы говорите достаточно громко
- Проверить выбранную модель — некоторые модели могут не поддерживать определённые языки
- Использовать инструкцию для указания языка
Текст совпадает с предыдущим
Дополнение не вставляет текст, если он полностью совпадает с последним вставленным. Это предотвращает случайные повторы. Если вы хотите вставить тот же текст повторно, просто измените его или подождите, пока не будет вставлен другой текст.
Запись не останавливается
Если запись не останавливается после нажатия комбинации клавиш, попробуйте перезапустить NVDA или использовать диспетчер задач для принудительного закрытия.
Горячие клавиши
| Комбинация | Действие |
|---|---|
| Control+Shift+D | Начать/остановить запись голоса |
| Control+Shift+G | Открыть настройки GeminiDictation |
Клавиши можно изменить через стандартный диалог «Жесты ввода» NVDA (меню NVDA → Параметры → Жесты ввода, категория «Gemini Dictation»).
Рекомендации по использованию
- Для наилучшего качества распознавания используйте модели pro для важных и длинных текстов
- Если вам нужна скорость, выбирайте модели flash или lite
- Экспериментируйте с инструкциями, чтобы найти оптимальную формулировку для ваших задач
- При работе с разными языками явно указывайте язык в инструкции
- Для повседневного использования достаточно бесплатного тарифа Gemini или Groq
- Следите за лимитами запросов — при превышении лимита дополнение сообщит об ошибке 429
Заключение
GeminiDictation — это мощный инструмент для быстрого ввода текста голосом, который значительно упрощает работу с компьютером. Благодаря поддержке современных моделей искусственного интеллекта и гибким настройкам, дополнение подходит для самых разных задач — от быстрых заметок до профессиональных диктовок.
Используйте дополнение регулярно, экспериментируйте с настройками и инструкциями, чтобы добиться наилучших результатов. По мере развития технологий распознавания речи возможности дополнения будут только расширяться.
История версий
История версий
| Версия файла | Тестируемая версия NVDA | Минимальная версия NVDA | Размер файла (КБ) | Ссылка на загрузку |
|---|---|---|---|---|
| 0.3 | 2026.1.0 | 2023.1.0 | 26 | GeminiDictation-V.0.3.nvda-addon |
| 0.2 | 2026.1.0 | 2023.1.0 | 12 | GeminiDictation-V.0.2.nvda-addon |